SRE-инженер (Site Reliability Engineer)

Summary

SRE handling L2/L3 incident management, production support, and monitoring for a financial brokerage. Day-to-day work spans log/metric analysis with ELK and Zabbix, PostgreSQL diagnostics, SLI/SLO tracking, and release change control across AWS/Yandex Cloud/Selectel environments.

Обязанности:
  • Управление инцидентами (L2/L3), эскалация и оперативное решение проблем

  • Анализ логов и метрик (ELK, Zabbix и др.)

  • Поддержка сервисов и участие в разборе инцидентов в продакшене

  • Сопровождение релизов, контроль изменений

  • Работа с PostgreSQL (диагностика, анализ данных, SQL-запросы)

  • Настройка мониторинга, определение критичных метрик и алертов

  • Контроль и участие в формировании SLI / SLO

  • Взаимодействие с разработчиками при поиске причин инцидентов

  • Проведение постмортем‑анализа и улучшение стабильности систем

  • Ведение задач в Jira, документации в Confluence

Требования:
  • Опыт работы в роли SRE / Production Support / L2-L3 Engineer от 2 лет

  • Понимание принципов SLI / SLO и incident management

  • Опыт работы с мониторингом (Zabbix, Prometheus или аналогичные системы)

  • Уверенную работу с реляционными БД (PostgreSQL)

  • Опыт работы с облаками (AWS / Yandex Cloud / Selectel)

Будет плюсом

  • Опыт настройки и администрирования Zabbix
  • Опыт работы с Elasticsearch / ELK‑стеком (настройка индексов, алертов, дашбордов)
  • Опыт работы с Kubernetes (на уровне понимания)
  • Опыт работы с Helm / Terraform (на уровне понимания)
  • Опыт в финтехе или высоконагруженных системах
Условия:
  • Официальное трудоустройство
  • Дежурства (без ночных смен, раз в 3 недели)

See also

要針對這個職缺調整履歷嗎?

目前無法檢查您與這個職缺的符合程度;請先將履歷加入個人檔案,下次即可查看。

A new version of freehire is available