Подписывайтесь на наш телеграм и будьте в курсе последних новостей в области ИИ в ИТ-мониторинге!

Статьи

Сбор данных мониторинга: как организовать систему с нуля

Отказ редко выглядит как внезапная авария. Чаще система заранее подаёт сигналы: растёт время ответа, заканчивается место на диске, увеличивается число ошибок, отдельные запросы начинают выполняться дольше обычного. Если команда не видит эти изменения или не может быстро связать их между собой, она узнаёт о проблеме уже после простоя — из обращения клиента, сообщения службы поддержки или отчёта о невыполненном SLA.

Мониторинг логов 1С: как устроен сценарий Artimate

В статье разбираем, как эта задача решена в сценарии Artimate: какие данные читает система, как устроен конвейер приёма логов, какие модули превращают миллионы строк журнала в граф блокировок, корреляцию метрик и понятную картину инцидента, и чем этот подход отличается от классических коммерческих решений для мониторинга 1С.

ИИ-мониторинг ИТ-инфраструктуры: как машинное обучение находит первопричину сбоя раньше дежурного инженера

Обнаружение аномалий и анализ причин на основе ИИ: использование машинного обучения на логах, метриках и трейсах для выявления скрытых аномалий производительности, угроз безопасности или сбоев в сложных облачных средах

Мониторинг сбоев в ИТ-инфраструктуре: как ИИ-детекторы аномалий меняют подход к устойчивости систем

Ключевой элемент современного мониторинга сбоев — детектор сбоев, конкретный алгоритм или модель внутри платформы, которая анализирует поступающий поток данных и принимает решение: есть отклонение от нормы или нет, критично оно или некритично.

AIOps в телекоме: сценарии применения, влияние на бизнес и техническую команду

В статье разобраны конкретные сценарии применения AIOps в телеком-секторе, показано, как платформа меняет работу SRE-специалистов и специалистов отделов мониторинга, какой эффект получает бизнес и на что обращать внимание при выборе решения.

Корреляционный граф в системе Artimate:от хаоса алертов к четкой картине инцидента

Что такое AIOps и зачем он нужен Представьте дежурного инженера в 3 часа ночи. На экране — 200 алертов за последние 5 минут. Упала база данных, залогировались ошибки в трёх микросервисах, Zabbix прислал предупреждение о нагрузке на CPU, wiSLA зафиксировал деградацию SLA по двум сервисам. Все сигналы приходят одновременно, каждый требует внимания — но ни […]

Искусственный интеллект  в Observability: интеллектуальный слой, который меняет управление инцидентами

Искусственный интеллект в observability — это не замена систем мониторинга. Это интеллектуальный слой над ними: инструмент, который обрабатывает поток данных из разных источников, устраняет шум, связывает разрозненные события в единую картину и помогает инженеру быстрее выйти на причину сбоя