Старший инженер надежности сайта
Переведено автоматически с языка оригинала. Читать оригинал по-английски →
О роли
Мы ищем старшего инженера надежности сайта, чтобы присоединиться к нашей команде инфраструктуры - небольшой и опытной команде, где ответственность высока и ожидания еще выше. Это глубоко практическая роль в центре высоконагруженной системы, где вы будете напрямую отвечать за поддержание надежности, производительности и стабильности в быстро меняющейся среде.
Вы будете работать над реальными производственными задачами, обрабатывать инциденты, управлять оповещениями и участвовать в критическом круглосуточном дежурстве. Эта роль требует стойкости, сильного принятия решений под давлением и проактивного мышления для постоянного улучшения систем, работающих в масштабе.
Если вы процветаете в высоконагруженных средах, любите решать сложные производственные проблемы и хотите оказывать прямое влияние на системы, используемые миллионами, - это место для вас.
Ключевые обязанности
- Обеспечивать надежность системы, активно отслеживая состояние платформы, управляя оповещениями и реагируя на инциденты в реальном времени
- Участвовать в круглосуточных дежурствах, принимая на себя полную ответственность за стабильность производства в высоконагруженной среде (5-7 тыс. RPS)
- Расследовать инциденты, проводить анализ коренных причин и реализовывать долгосрочные исправления, чтобы предотвратить повторение
- Создавать и постоянно улучшать мониторинг, оповещение и наблюдаемость в экосистеме Kubernetes (EKS)
- Развертывать, управлять и оптимизировать инфраструктуру с помощью Terraform, Helm и инструментов GitOps (Flux/ArgoCD)
- Стимулировать автоматизацию и проактивно улучшать устойчивость системы, снижая ручное вмешательство и повторяющиеся проблемы
- Поддерживать и развивать конвейеры CI/CD и практики инфраструктуры как кода
- Сотрудничать с инженерными командами для поддержки развертываний и минимизации воздействия на пользователей в живой среде
- Внедрять и интегрировать новые инструменты и технологии для повышения масштабируемости, надежности и производительности
- Обрабатывать запросы, специфичные для среды, и обеспечивать бесперебойную повседневную работу платформы под постоянной нагрузкой
Требования
- Опыт работы с Kubernetes (развертывание, масштабирование, устранение неполадок) в высоконагруженных средах
- Опыт работы с инструментами GitOps, такими как FluxCD или ArgoCD
- Подтвержденный опыт реагирования на инциденты, анализа коренных причин и постмортемов в производственных системах
- Опыт работы с AWS, Terraform, Docker и конвейерами CI/CD
- Опыт работы с инструментами мониторинга и наблюдаемости, такими как Datadog, Prometheus, Grafana, и стеками журналов, такими как ELK или CloudWatch
- Глубокое понимание концепций и протоколов сетевого взаимодействия
- Профессиональное владение хотя бы одним языком сценариев (например, Python, Go, Node.js)
- Опыт работы с системами контроля версий (Git)
- Знакомство с инструментами управления инцидентами, такими как PagerDuty, Opsgenie, или аналогичными
- Способность эффективно работать в быстро меняющейся, высоконапряженной среде с высокой степенью ответственности и подотчетности
- Проактивное, стойкое мышление с фокусом на постоянном улучшении и стабильности системы
Что мы предлагаем
- Конкурентная зарплата
- Ежеквартальные бонусы
- Неограниченный оплачиваемый отпуск
- Неограниченный оплачиваемый отпуск по болезни
- Удаленная и гибкая работа
- Частное медицинское страхование
- Финансовая поддержка для жизненных событий
- Бюджет на профессиональное развитие
- Международное взаимодействие
- Регулярные корпоративные мероприятия
*Преимущества могут варьироваться в зависимости от местоположения и условий трудового договора
Процесс набора
1. Собеседование с HR (30-45 мин)
2. Техническое собеседование (90 мин)
4. Финальное собеседование с руководителем высшего звена (60 мин)
Подавая заявку, вы подтверждаете, что ваши личные данные будут обрабатываться в соответствии с нашей Политикой конфиденциальности.
Мы публикуем копию этого объявления, чтобы его нашли те, кто ищет работу в Грузии, со ссылкой на первоисточник. Если оно ваше, вы можете взять управление им на себя, или попросить нас его снять.
Полученное объявление становится прямым: показывается выше зеркальных копий, отклики приходят в вашу панель, а объявление попадает в поиск вакансий Google.