Traditional monitoring
Состояние
- Какая CPU, latency или error rate сейчас?
- Где пересечён порог?
- Какой компонент перегружен?
Resilience observability / концепция
Привычные метрики могут оставаться нормальными, пока устойчивость системы уже падает. PhaseShift изучает, как инфраструктура реагирует на реальные возмущения и как быстро возвращается к собственному устойчивому режиму.
Все привычные индикаторы ещё зелёные. Характер реакции системы уже изменился.
01 / другой объект наблюдения
Не ещё один dashboard и не замена observability-стеку. PhaseShift рассматривает эпизод как цепочку: возмущение → отклик → распространение → восстановление.
Traditional monitoring
Resilience analysis
02 / пассивно по умолчанию
Базовая ценность строится на наблюдении естественных событий в работающей инфраструктуре — без намеренного создания отказов.
01
Агенты собирают системную, сетевую и процессную телеметрию.
02
Автоматически строится наблюдаемая карта реальных зависимостей.
03
Находим естественные возмущения: всплеск, задержку, retry, рестарт.
04
Оцениваем отклик, распространение и возвращение к baseline.
03 / recovery time
Две системы могут выглядеть одинаково по CPU, latency и error rate. Но одна возвращается к baseline за секунды, а другая — заметно дольше. Именно тренд восстановления — сигнал для исследования.
Смысл не в обещании предсказать любой отказ, а в измерении изменения динамических свойств и выявлении признаков снижения способности системы восстанавливаться.
04 / explainable score
Единый показатель полезен только тогда, когда его можно разложить до факторов, компонентов, событий-возмущений и исходных сигналов.
Иллюстративная декомпозиция, не обещание готовой формулы.
05 / dynamic topology
Связи описываются по наблюдаемым взаимодействиям: направление, частота, протокол, latency, retries и изменение во времени.
06 / deployment model
Коробочная on-premise модель: телеметрия и анализ разворачиваются в инфраструктуре заказчика. Основной слой опирается на наблюдаемое поведение ОС, процессов и сети; дополнительные адаптеры лишь обогащают контекст.
Base layer
Host sensor, системная и сетевая телеметрия, динамический граф, perturbation detection, recovery time и propagation.
Additional layer
Контекст из БД, Kubernetes, брокеров, Prometheus, OpenTelemetry и существующего observability stack — не обязательное условие первой установки.
07 / scientific basis
Фазовый переход здесь — аккуратная метафора. Полезны идеи early-warning indicators: critical slowing down, время восстановления, чувствительность, автокорреляция, дисперсия и распространение реакции по графу.
После сходного малого возмущения система может возвращаться к равновесию всё медленнее.
Система сравнивается прежде всего со своим устойчивым режимом с учётом времени, нагрузки и контекста.
Корректный вывод может быть и таким: «данных недостаточно». Не каждый класс отказа имеет наблюдаемую предаварийную динамику.
следующий разговор
Расскажите о вашем контуре и observability-стеке. Если подход релевантен, начнём с обсуждения наблюдаемых возмущений, baseline и безопасного первого контура.
Запросить демо