Ранее качество связи оценивали в основном по факту — пользователь столкнулся с проблемой, обратился в поддержку, после чего оператор начинал искать причину. Современные сети постоянно собирают данные о своей работе, а ИИ анализирует их в реальном времени, фиксирует отклонения от нормы и предлагает решение проблемы еще до того, как абонент поймет, что что-то не так. О том, как это работает, рассказывает Дмитрий Горев, руководитель центра разработки алгоритмов машинного обучения направления Т1 ИИ (ИТ-холдинг Т1).

Сеть сама делится тем, что с ней происходит
Сегодня оператору не нужно ждать жалоб, чтобы понять, что в каком-то районе ухудшилось качество связи. Базовые станции, транспортные каналы и ядро сети каждые несколько минут передают тысячи параметров: долю неуспешных вызовов и обрывов, задержки, скорость передачи, уровень сигнала и помех. К ним добавляются отчеты телефонов об условиях радиосвязи и данные о качестве пользовательских сессий.
ИИ строит для каждой соты и группы абонентов профиль нормального поведения. Если показатели отклоняются от него, система фиксирует проблему. Алгоритмы способны обнаруживать падение скорости, ухудшение качества звонков, обрывы соединения и перегрузку базовых станций. Они также замечают «спящие» соты, износ антенн и кабелей, внешние радиопомехи, стареющее оборудование и сбои после обновлений ПО. И поскольку для крупного оператора это миллиарды событий в сутки, данные анализируются потоково.
ИИ учится видеть проблему до сбоя
Следующий шаг после анализа данных — прогнозирование. Модель знает суточный и недельный профиль каждой соты и может заранее оценить будущую нагрузку. Если утилизация радиоресурсов, число активных абонентов и очереди растут быстрее ожидаемого, это становится сигналом возможной перегрузки.
В прогнозе также учитываются внешние данные. Например, оператор может заранее иметь в виду концерт или спортивный матч. При этом горизонт планирования для каждой ситуации будет разным. Перегрузки из-за праздников, концертов или сезонных перемещений можно прогнозировать за дни и даже недели. Суточные пики — за часы. Причем система способна распознать перемещение большой массы людей и рассчитать нагрузку еще до того, как толпа окажется в конкретном месте. Постепенную деградацию оборудования можно увидеть за дни до отказа по росту числа ошибок, температуре или падению уровня сигнала.
С внезапными авариями все сложнее. Здесь счет может идти на минуты, поэтому ценность ИИ заключается прежде всего в быстрой локализации причины. Кроме того, алгоритм должен отличать серьезный инцидент от случайного отклонения. Для этого он сопоставляет данные по сотам и абонентам и ищет общий элемент в топологии сети. Кратковременный выброс на одной соте, скорее всего, окажется шумом. Одновременная деградация целого кластера, подключенного к одному транспортному узлу, — уже сигнал о масштабной проблеме.
Когда сеть исправляет себя сама
Однако важнее то, что сеть способна не только спрогнозировать проблему, но и самостоятельно выполнить часть действий по ее устранению. Технологии SON (Self-Organizing Network) позволяют автоматически балансировать нагрузку между сотами и частотными диапазонами, менять мощность и наклон антенн, устранять конфликты идентификаторов. Также есть функции самолечения, например, перезапуск зависших модулей, переключение на резерв, откат неудачной конфигурации.
Также ИИ может самостоятельно перераспределять нагрузку и менять параметры оборудования. В радиосети он способен переводить абонентов между несущими и диапазонами, менять параметры мобильности и электрический наклон антенн. В транспортной сети SDN-контроллеры могут переводить трафик на альтернативный маршрут при деградации канала. При этом автоматические действия выполняются в рамках заранее согласованных сценариев и допустимых значений. Система проверяет результат и откатывает изменение, если качество не улучшилось.
Специалист все еще остается частью контура управления. Автоматике доверяют локальные и обратимые действия, которые многократно проверены. За инженером остаются масштабные изменения на уровне ядра или целого региона, физические работы и нестандартные ситуации, в которых модель показывает низкую уверенность.
В отрасли используется шкала автономности от L0 до L5. Большинство операторов сегодня находится на уровнях L2-L3 — система уже предлагает решения и частично выполняет их, но контроль остается у инженера.
Что это дает оператору и абоненту
Согласно отраслевым оценкам, проактивное управление режимом сокращает количество обращений от клиентов на десятки процентов. А по инцидентам, которые все же успевают дойти до абонентов, цикл начинается с готового диагноза и списка затронутых элементов. В среднем после внедрения ИИ время восстановления процессов сокращается на 30–50%.
Экономический эффект складывается сразу из нескольких направлений. Помимо того, что поддержка получает меньше обращений и быстрее понимает состояние сети в конкретной точке, эксплуатация сокращает число ложных выездов благодаря автоматической корреляции аварий.
Кроме того, энергопотребление радиосети можно снижать за счет интеллектуального отключения неиспользуемых мощностей — по отраслевым данным, на 10–25%. Также меняется подход к инвестициям: емкость расширяют там, где дополнительная нагрузка подтверждается прогнозом, а не примерными выводами из текущих показателей, — это значительно снижает существующие риски.
От управления сетью к управлению по намерению
Полностью автономные сети пока остаются целью. Главный барьер состоит в том, что неверное действие алгоритма в ядре сети может затронуть сотни тысяч абонентов. Есть и технические ограничения — оборудование разных производителей и поколений, закрытые интерфейсы, неполные данные и проблема объяснимости решений ИИ.
Следующий этап — управление сетью по намерению в связке с цифровыми двойниками (intent-based networking). Оператор сможет задать цель, а не конкретные настройки. Например, чтобы в определенном районе видео загружалось без задержек. Система сама подберет конфигурацию и сначала проверит ее на цифровой копии сети, где ошибка не затрагивает реальных абонентов.
Генеративные модели тоже станут частью этого контура. ИИ-ассистент в центре управления на вопрос вроде «почему выросли обрывы в северном кластере» сможет собрать ответ из телеметрии, документации и истории инцидентов.
Так сеть постепенно превратится из системы, которой управляют инженеры, в систему, способную самостоятельно контролировать значительную часть своей работы. До полностью автономного уровня L5 отрасли еще предстоит пройти путь. Но ключевой переход происходит уже сейчас: сеть сама контролирует свою работу и не ждет, пока ошибку заметит кто-то другой.
Читайте также: