Senior Linux Administrator - Infrastructure Engineering & Automation
Разрабатывал и внедрял решения в крупной сегментированной Linux-инфраструктуре с разграничением доступа. Настраивал необходимые сетевые соединения и доступы к сервисам для автоматизации, внутренних приложений и платформенных решений.
- С нуля спроектировал и запустил в AWS GPU/ML-платформу для команды из примерно 15 ML-инженеров в двух проектах: обучение и inference моделей, хранение данных и выполнение ML-пайплайнов. Использовал EC2 GPU, Aurora PostgreSQL, S3/EFS и контейнерный стек. Настроил доступы, мониторинг и резервное копирование.
- Разработал и развернул на более чем 10 000 Linux-хостах Go-клиент, применяющий правила доменного доступа из централизованной системы управления.
- Спроектировал и внедрил production-инфраструктуру HAProxy для критичных платежных сервисов VTS и 3D Secure: SSL termination и резервную маршрутизацию. Этот резервный контур впоследствии стал основным.
- Разработал внутреннее приложение для инвентаризации и контроля Java с интеграциями Foreman, Ansible, CMDB и MS SQL. Сканирует более 8 000 хостов, отслеживает дистрибутивы и владельцев, рассылает уведомления, выявлено 370+ хостов с Oracle Java среди более 4 400 систем с Java.
- Разработал систему выявления потенциально неиспользуемых VM на основе 10+ признаков. Выявлено 99 кандидатов, выведено из эксплуатации 27 VM, освобождено 113 vCPU и 353 GB RAM.
- Развивал Puppet-конфигурацию Linux-парка: мигрировал инфраструктуру на Puppet 8, разрабатывал manifests/facts, интеграции с AWX и Git. Автоматизировал контроль конфигураций, сбор свидетельств для аудита и применение требований PCI DSS к доступам и настройкам безопасности.
- Взаимодействовал с подразделениями информационной безопасности по устранению уязвимостей и обновлению ОС в системах, входящих в область PCI DSS, и других чувствительных контурах. Выполнял обновления, в том числе с использованием предварительно настроенной автоматизации.
- Автоматизировал вывод серверов из эксплуатации и развертывание кластеров ClickHouse и Elasticsearch, сократив число ручных операций и влияние человеческого фактора.
- Эксплуатировал AWS-инфраструктуру и 50+ proxy-серверов в нескольких регионах; автоматизировал ротацию IP и оптимизировал выбор типов EC2. Настраивал доступы, сетевые ограничения и передачу логов в SOC для AWS- и AI-инфраструктуры.