Отказ редко выглядит как внезапная авария. Чаще система заранее подаёт сигналы: растёт время ответа, заканчивается место на диске, увеличивается число ошибок, отдельные запросы начинают выполняться дольше обычного. Если команда не видит эти изменения или не может быстро связать их между собой, она узнаёт о проблеме уже после простоя — из обращения клиента, сообщения службы поддержки или отчёта о невыполненном SLA.
Статьи
В статье разбираем, как эта задача решена в сценарии Artimate: какие данные читает система, как устроен конвейер приёма логов, какие модули превращают миллионы строк журнала в граф блокировок, корреляцию метрик и понятную картину инцидента, и чем этот подход отличается от классических коммерческих решений для мониторинга 1С.
Почему классический ручной SRE не справляется с современной инфраструктурой? Рассказываем, как искусственный интеллект может помочь в работе SRE-инженера
Обнаружение аномалий и анализ причин на основе ИИ: использование машинного обучения на логах, метриках и трейсах для выявления скрытых аномалий производительности, угроз безопасности или сбоев в сложных облачных средах
Инцидент в ИТ-инфраструктуре стоит компании денег с первой минуты простоя. Пользователи не могут работать, SLA нарушается, служба поддержки завалена обращениями
Ключевой элемент современного мониторинга сбоев — детектор сбоев, конкретный алгоритм или модель внутри платформы, которая анализирует поступающий поток данных и принимает решение: есть отклонение от нормы или нет, критично оно или некритично.
В статье разобраны конкретные сценарии применения AIOps в телеком-секторе, показано, как платформа меняет работу SRE-специалистов и специалистов отделов мониторинга, какой эффект получает бизнес и на что обращать внимание при выборе решения.
Что такое AIOps и зачем он нужен Представьте дежурного инженера в 3 часа ночи. На экране — 200 алертов за последние 5 минут. Упала база данных, залогировались ошибки в трёх микросервисах, Zabbix прислал предупреждение о нагрузке на CPU, wiSLA зафиксировал деградацию SLA по двум сервисам. Все сигналы приходят одновременно, каждый требует внимания — но ни […]
Как объединить разрозненные системы мониторинга, сократить MTTR до 50% и снизить информационный шум на 95% на базе AIOps-платформы Artimate
Искусственный интеллект в observability — это не замена систем мониторинга. Это интеллектуальный слой над ними: инструмент, который обрабатывает поток данных из разных источников, устраняет шум, связывает разрозненные события в единую картину и помогает инженеру быстрее выйти на причину сбоя
