Описание
Описания нет
Задачи
- Поддерживать стабильность продакшна, оперативно реагировать на инциденты
- Проводить периодические плановые тестирования продакшена на отказоустойчивость
- Писать простые скрипты автоматизации (Bash/Python)
- Мониторить ключевые метрики (CPU, RAM, диск, сеть, latency, ошибки)
- Тюнить ОС и сервисы, оптимизировать конфигурацию
- Эксплуатировать Ceph (OSD, пулы, CRUSH), Pacemaker (ресурсы, failover, quorum, fence), KVM (ВМ, libvirt), Patroni (кластеры PG, failover)
- Работать с бэкапами (проверять целостность, оценивать RPO и RTO)
Требования
- Уверенный Linux‑админ (systemd, journald, dmesg, strace, tcpdump, iostat и т. п.)
- Сетевые знания (TCP/IP, DNS, HTTP, балансировка, файрволы)
- Опыт с PostgreSQL(Patroni), Rabbit, Kafka, Nginx, Ceph, Pacemaker, KVM, Mongodb
- Мониоринг Zabbix, Grafana, Prometheus
- Понимание сборки логов на базе стека ELK
- Умение автоматизировать без избыточности
- Вы подходите, если
- Отказоустойчивость для вас не только формальность
- Решаете своевременно задачи простым и надёжным способом
- Не копируете готовые решения без понимания подкапотных механизмов
- Комфортно работаете в консоли
- Спокойно используете plain‑конфиги, systemd units, bash
- Огромным плюсом будет
- Знания Spine-Leaf архитектуры
- Постороение сетей Multi-Pod на базе Evpn+Vxlan, LAG, VRRP, протоколы динамической маршрутизации
- Умение настраивать Cisco, Mikrotik и другое сетевое оборудование
- Понимание cgroups, ulimit, sysctl
- Глубокое понимание специфики Ceph, Pacemaker, KVM, Patroni (диагностика, failover, split‑brain, кворум, NUMA и т. д.)
Условия
- Стабильный конкурентный доход
- 24 календарных дней ежегодного отпуска
- Пятидневная рабочая неделя
- Свободную и открытую атмосферу с развитой культурой обратной связи, где ваши идеи и мнение важны
- Работа гибридного/удаленного формата
#J-18808-Ljbffr