SRE в команду АИ-платформы

Russia9 часов назад
Формат работы:Гибрид
Уровень опыта:Средний уровень

Описание должности

Ищем SRE в команду AI-платформы.

Проект — высоконагруженный сервис, который позволяет компаниям загружать внутренние документы и использовать их как базу знаний для ИИ. Сервис сам индексирует документы, выполняет поиск нужной информации и передает найденные данные LLM для формирования ответов на вопросы пользователей.

Что делать

  • Отвечать за стабильность и надежность production-среды.
  • Настраивать и развивать SLI/SLO, метрики, алерты, дашборды и ранбуки.
  • Повышать наблюдаемость и отказоустойчивость сервисов.
  • Участвовать в расследовании и устранении инцидентов.
  • Проводить постмортемы и разрабатывать меры для предотвращения повторных аварий.
  • Разрабатывать и поддерживать планы аварийного восстановления (DRP).
  • Участвовать в развитии процессов и практик SRE.

Что важно

  • Уверенно работать с Linux и иметь опыт промышленной эксплуатации систем.
  • Понимать принципы load balancing, circuit breaker, disaster recovery и других механизмов отказоустойчивости.
  • Хорошо понимать SLI/SLO и уметь применять их на практике.
  • Опыт работы с Kubernetes, Grafana и Prometheus.
  • Понимать принципы IaC.
  • Разбираться в сетях и уметь находить и устранять проблемы сетевого взаимодействия.

Будет плюсом:

  • Go, Python, Bash.
  • Опыт проектирования отказоустойчивых и масштабируемых сервисов.
  • Опыт работы с системами управления конфигурациями.

Условия

  • Оформление по ТК РФ.
  • Конкурентная зарплата + годовой бонус.
  • ДМС со стоматологией с возможностью подключить родственников.
  • Гибридный или удалённый формат работы на территории РФ.

Упомянутые навыки

Откликнуться на вакансию

Use the application link supplied with this listing to apply to HR Prime. Check the destination before entering personal information.