Следите за новостями по этой теме!
Подписаться на «Рифы и пачки / Твоя культура»
Цена перемен. Сложность информационных систем стала причиной сбоев
Современные информационные системы можно сравнить с огромным мегаполисом: здесь каждый сервис переплетён с десятками других маршрутов, а за каждый угол отвечает отдельная команда айтишников. Такая структура помогает бизнесу быстро запускать новые цифровые сервисы. Однако чем больше становится этот "город", тем больше растёт число технических взаимозависимостей — и тем выше риск, что что-то пойдет не так.
По данным свежего отчёта Uptime Institute за 2025 год, для владельцев и операторов дата-центров предотвращение сбоев — задача стратегическая. Отчёт отмечает: оборудование становится надёжнее, подходы к устойчивости совершенствуются, но внешние угрозы и усложняющаяся архитектура порождают новые опасности. Важно научиться управлять ими заранее.
Как это выглядит изнутри крупных цифровых корпораций? Сергей Наумов, старший разработчик серверной части и специалист по информационной безопасности, рассказал о своём опыте автоматизации управления TLS-сертификатами — это те самые цифровые документы, которые отвечают за защищённую передачу данных и напрямую влияют на стабильную работу сервисов.
Почему сложность — источник сбоев
На вопрос, почему именно сейчас сложность бьёт по надёжности айти-систем, Наумов отвечает: проблема сертификатов — не только в их сроках действия. Один сертификат должен быть связан с владельцем сервиса, встроен в доверенную цепочку, соответствовать строгим политикам, храниться в безопасности и вовремя обновляться. Всё это надо автоматизировать. Иначе — всё развалится.
Сегодняшние системы — это десятки кластеров, сотни микросервисов на платформе Kubernetes, облака, внутренние инструменты. Здесь сервисы зависимы друг от друга, а команды пилят свои куски инфраструктуры одновременно. Элементарная диагностика одной аварии может занять часы: чтобы найти виновного, инженеры карабкаются по цепочке зависимостей и выясняют, кто отвечает за какой гвоздик.
Есть особо опасные зоны — доступы, секреты и сертификаты. Их тысячи, и они всё время обновляются. Если какая-нибудь бумажка — цифровой сертификат — случайно просрочится, никто из пользователей не заметит причин: просто сайт не откроется, сервис ляжет, половина продукта отвалится. Для бизнеса это деньги, для клиента — раздражение. Если всё держится на ручном управлении, человеческий фактор рано или поздно выстрелит.
Рецепт: просто, надёжно, предсказуемо
Наумов был ключевым инженером по автоматизации выпуска и обновления сертификатов. Раньше управлением занималась одна большая команда. По мере роста корпоративного "мегаполиса" эта схема ломается — переходят на сервисный подход: каждая команда сама рулит своими сертификатами с помощью единого инструмента. Важно встроить "центр сертификации" в общую инфраструктуру и сделать так, чтобы всё работало само.
Инструмент, который Наумов разрабатывал, работает по типу Certbot, только заточен под корпоративные задачи: интеграция с внутренними платформами, безопасность по полному циклу.
Сложности? Как всегда: всё разное, всё нестандартное. Нужно, чтобы автоматизация одинаково работала в облаках, в Kubernetes, на внутренней железке — чтобы ни у кого не дёрнулась рука что-то "подкрутить" вручную (иначе объявится новый ЧП). Второе — понятно распределить ответственность: если команда рулит сертификатами, инструмент должен быть настолько прост и надёжен, чтобы никто не искал окольные пути, иначе всё опять рассыпается.
Польза для бизнеса: меньше аварий, связанных с истекшими сертификатами; автоматизация исключает целый класс сбоев; проще масштабировать инфраструктуру, бизнес растёт — и не боится обрушения. Всего проект покроет около 2000 сертификатов, удобен для всех айтишников компании.
Человек-не-машина, ИИ — в помощь
Что важно для надёжности современных ИТ-систем? Не столько код, сколько процессы вокруг него. Нужно понимать, кто отвечает за что, как происходит обновление, где ловить ошибки, кто их чинит и кто отвечает перед начальством.
Исходит вопрос про искусственный интеллект: может помочь? Наумов уверен — да, если грамотно встроен в инфраструктуру. ИИ помогает анализировать кучу данных, диагностировать аномалии и подсказывать причины сбоев. Главное — не очередной игрушкой быть, а стать частью инженерного процесса: мониторинг, журналирование, управление должны плотно взаимодействовать.
Личное мнение: будущее профессии — архитектура больших систем, построение надежных процессов, которые не падают под грузом роста. Пока развиваю проект в своей компании, параллельно расту в управлении, чтобы, когда-нибудь, отвечать за всю архитектуру и надёжность цифровой империи.
*Цена перемен звучит красиво, но внутри, как обычно, анализ очередной ИТ-аварийки на деньги корпораций. Команда разрослась — начались сбои, ведь чем больше клубок микросервисов, тем изобретательнее баг. Новое и в отчёте Uptime Institute: техника хороша, архитектура сложнее, сапожники остались те же. Зря ли весь текст — гимн автоматизации, которую навязывает страх ответственности. Сергей Наумов честно говорит: если выдачу сертификатов и контроль доступа не отдать железу, в итоге либо сервис ляжет на каникулы, либо у бизнес-пользователей снова поростут седые волосы. Модель «одна команда — ручное управление» умерла: масштаб корпорации давит, все пересорились, никто не придёт чинить твой сертификат в 3 ночи бесплатно. В итоге: нужен универсальный инструмент — как Certbot, но чтобы ни один разработчик не додумался что-то допилить руками. Автоматизация — единственный способ не угробить инфраструктуру. ИИ? Принесите его, если он умеет не только анализировать логи, но и дружит с мониторингом. Вывод: системные инженеры и архитектора превращаются в заложников собственных процессов, чей успех измеряется количеством незабытого обновления. Корпоративный ИТ-мир по-прежнему потеет: кто не автоматизирует, тот носит воду решетом. И всё это на ваших глазах — в очередном иллюстрированном кейсе концептуального айтишника с хроническим цинизмом.