Технический менеджер программ, центры обработки данных
Переведено автоматически с языка оригинала.
О Nebius:
Nebius возглавляет новую эру в облачной инфраструктуре для глобальной экономики ИИ. Мы создаем полнофункциональную облачную платформу ИИ, которая поддерживает разработчиков и предприятия от обучения данных и моделей до развертывания в производстве, без затрат и сложности создания большой внутренней инфраструктуры ИИ/МО.
Построенная инженерами для инженеров. От крупномасштабной оркестровки GPU до оптимизации вывода, мы владеем сложными проблемами в области вычислений, хранения, сетевого взаимодействия и прикладного ИИ.
Входит в список Nasdaq (NBIS) и штаб-квартирой в Амстердаме, мы имеем глобальное присутствие с центрами исследований и разработок по всей Европе, Великобритании, Северной Америке и Израилю. Наша команда из более 1 500 человек включает сотни инженеров с глубоким опытом в области аппаратного, программного обеспечения и исследований и разработок ИИ. Роль Мы ищем технического менеджера программ для управления оперативной готовностью и текущим состоянием нашего флота центров обработки данных, как COLO, так и BTS. В этой роли вы будете единственной точкой ответственности за обеспечение работы каждого сайта в соответствии с ожиданиями - выполнение SLA, выполнение планового обслуживания и прохождение аудитов - в растущем портфеле объектов, эксплуатируемых арендодателями, и специально построенных объектов. Вы будете выступать в качестве основного интерфейса между Nebius и арендодателями и операторами наших центров обработки данных, и будете тесно сотрудничать с командой ИТ Nebius, чтобы перевести операционную деятельность на уровне сайта в надежную инфраструктуру для наших клиентов. Это позиция индивидуального участника для человека, который одинаково комфортно чувствует себя при проверке contractual SLA, планировании окна обслуживания и физическом аудите сайта. Вы определите механизмы, которые делают наши сайты ответственными и выявляют риски до того, как они станут инцидентами. Основные обязанности - Управлять оперативной надежностью сайтов Nebius COLO и BTS, обеспечивая работу каждого объекта в соответствии с ожиданиями в области питания, охлаждения, пространства, связности, безопасности и экологического контроля.
- Отслеживать, контролировать и обеспечивать соблюдение SLA с арендодателями и провайдерами колокации; выявлять нарушения, стимулировать устранение и привлекать поставщиков к ответственности за договорные обязательства.
- Управлять и координировать графики технического обслуживания сайтов - профилактического и корректирующего - включая планирование и утверждение окон обслуживания, проверку методов процедуры (MOP) и минимизацию рисков для живых нагрузок.
- Планировать и проводить аудиты сайтов, охватывающие соблюдение требований, мощность, производительность питания/охлаждения, физическую безопасность и безопасность; отслеживать результаты до их закрытия.
- Выступать в качестве основного повседневного интерфейса с арендодателями и операторами центров обработки данных, управляя операционными отношениями, эскалациями и координацией деятельности на объекте.
- Тесно сотрудничать с командой ИТ Nebius при развертывании, планировании мощности, реагировании на инциденты и управлении изменениями на каждом сайте.
- Создание механизмов отчетности и панелей управления, которые обеспечивают руководство четкой видимостью состояния сайта, выполнения SLA, статуса обслуживания и открытых рисков в портфеле.
- Руководство координацией инцидентов и последующим анализом, включая анализ коренных причин и отслеживание корректирующих действий с арендодателями и внутренними командами.
- Отслеживание и управление контрактными операционными обязательствами, результатами и сроками выполнения по нескольким сайтам и поставщикам одновременно.
О команде Команда дата-центров отвечает за физическую инфраструктуру, лежащую в основе облака ИИ Nebius. Мы управляем полным жизненным циклом нашего COLO и BTS - от ввода в эксплуатацию новых мощностей до обеспечения надежной работы действующих сайтов в масштабе. Мы работаем на стыке эксплуатации объектов, управления поставщиками и ИТ-инфраструктурой, и мы работаем быстро, потому что рабочие нагрузки ИИ наших клиентов зависят от надежности, которую мы обеспечиваем.
Основные требования - 10+ лет опыта в управлении техническими программами, эксплуатации дата-центров или управлении критическими объектами/инфраструктурой.
- Опыт управления инфраструктурой и эксплуатацией дата-центров (электроснабжение, охлаждение, пространство, связность) в средах колокации, построения под заказ или собственных средах.
- Опыт управления сторонними поставщиками, арендодателями или сервисными провайдерами в соответствии с SLA и контрактными обязательствами.
- Демонстрированная способность управлять несколькими программами, сайтами или потоками работ одновременно и добиваться измеримых результатов.
- Степень бакалавра в соответствующей области или эквивалентный практический опыт.
Предпочтительные требования - Прямой опыт работы с моделями колокации (COLO) и построения под заказ (BTS) дата-центров, включая эксплуатацию по нескольким арендодателям и операторам.
- Рабочие знания SLA дата-центров, MOP/SOP, режимов обслуживания и рамок аудита и соответствия (например, стандарты Uptime Institute Tier, SOC 2, ISO 27001).
- Опыт поддержки инфраструктуры ИИ/HPC, кластеров GPU или других высокоплотных вычислений.
- Сильная familiarity с управлением инцидентами и анализом коренных причин в контексте критических объектов.
- Опыт создания механизмов отчетности, панелей управления или операционных карточек для состояния инфраструктуры и риска.
- PMP, Uptime ATD или эквивалентная сертификация программы/операций.
- Умение работать с программами и инструментами ticketing (например, Jira, ServiceNow) и комфорт при работе с операционными данными.
- Готовность к поездкам на сайты по мере необходимости.
Выгоды и привилегии:
- Конкурентная компенсация
- Возможности карьерного роста и обучения
- Гибкость и собственничество
- Коллаборативная и инновационная культура
- Возможность работать над impactful ИИ-проектами
- Международная среда и талантливые команды
Что значит работать в Nebius:
Динамичное развитие - Смелое мышление - Постоянный рост - Значимое влияние - Доверие и реальная ответственность - Возможность формировать будущее ИИ
Заявление о равных возможностях:
Мы публикуем копию этого объявления, чтобы его нашли те, кто ищет работу в Грузии, со ссылкой на первоисточник. Если оно ваше, вы можете взять управление им на себя, или попросить нас его снять.
Полученное объявление становится прямым: показывается выше зеркальных копий, отклики приходят в вашу панель, а объявление попадает в поиск вакансий Google.