Head of SRE в облачном провайдере: отвечаю за надёжность, observability и платформенную инфраструктуру. За плечами 15+ лет в инфраструктуре — кибербезопасность (строил WAF-as-a-Service), highload в классифайдах, финтех. Прошёл путь от инженера до руководителя, поэтому одинаково предметно говорю и про архитектуру, и про то, как объяснить её ценность бизнесу.
Вхожу в программный комитет DevOpsConf — каждый год отсматриваю десятки докладов и вижу, какие проблемы реально болят у команд эксплуатации.
Веду блог «Мишка на сервере» с 2013 года и телеграм-канал про SRE и надёжность. Подробнее об опыте — на savinmi.ru.
SRE и эксплуатация
Выстроить SRE-практику с нуля: SLI/SLO, error budget, работа с инцидентами и постмортемами
Навести порядок в on-call — так, чтобы дежурства не выжигали команду
Разобрать observability-стек: что собирать, что оставить, за что не переплачивать
Найти в архитектуре точки отказа и понять, что чинить первым
Процессы и команда
Наладить коммуникацию между эксплуатацией и разработкой
Первые месяцы в роли лида: делегирование, найм, оценка инженеров
Защитить инфраструктурную инициативу перед C-level — перевести технический долг на язык денег и рисков
Карьера
Понять, куда двигаться дальше: вглубь в инженерию или в управление
Подготовка к собеседованиям на SRE/DevOps/Lead, разбор System Design
Резюме и самопрезентация: что читает нанимающий менеджер
Формат: созвон на час. До встречи прошу коротко описать ситуацию и вопрос — так мы не тратим первые двадцать минут на введение. После присылаю резюме с конкретными шагами.