
Старший Data Engineer в команду Spark
в Avito
Технологии/инструменты
Исправленный вариант:
В работе мы ставим амбициозные цели и не останавливаемся на достигнутом. Поэтому для нас так важно, чтобы каждый участник большой команды "Авито" разделял культуру компании. Погрузиться в неё помогает Манифест, в котором собраны наши основные ориентиры — миссия, ценности, принципы работы.
О команде
Мы — кросс-функциональная команда, которая развивает аналитическую платформу на базе экосистемы Hadoop и Spark для пакетной обработки данных:
- Выполняем продуктовые задачи: реализуем сервисы для доступа к данным, выстраиваем процессы аналитики, фокусируемся на сборе статистики взаимодействий с поисковой и рекомендательной выдачей.
- Тесно взаимодействуем с другими командами по вопросам аналитики с помощью наших инструментов, улучшаем практики использования Spark в других командах, принимаем данные из разных источников: Trino, ClickHouse, Kafka.
- Развиваем платформу: поддерживаем и оптимизируем ETL-пайплайны, DQ-процессы и сбор метрик.
Серверная инфраструктура, поддержка оборудования и обновление ОС — зона ответственности отдельной команды инфраструктуры, с которой мы тесно взаимодействуем.
Какие задачи вас ждут
- Разрабатывать новые и поддерживать существующие продукты в составе кросс-функциональной команды.
- Развивать существующую Big Data-платформу с учётом растущей нагрузки от новых задач и данных: 90% задач связаны со Spark.
- Создавать новые сервисы на Python и улучшать существующие.
- Внедрять инженерные практики и делиться с командой своим опытом.
- Предлагать новые подходы и быстро проверять их в продакшене на реальных данных.
Мы ждем, что вы
- Пишете на Python или Java/Scala и готовы перейти на Python.
- Глубоко понимаете экосистему Hadoop/Spark/Hive и связанные продукты.
- Работали с данными и решали аналитические задачи.
- Умеете администрировать Linux-системы на базовом уровне.
- Готовы искать нестандартные решения.
Будет здорово, если вы:
- Имеете опыт работы с Apache Airflow, знаете принципы построения пайплайнов.
- Разрабатывали бэкенд-приложения на FastAPI, Zero, Flask, Asyncio, Django, другом Python-фреймворке или Go.
- Разбираетесь в инфраструктуре Apache Kafka.
- Писали стриминговые приложения на Apache Flink/Spark.
- Использовали оркестраторы кластеров для администрирования: Ansible, SaltStack, Puppet и другие.
- Умеете писать тесты, знаете и применяете подходы TDD, BDD, собирали CI/CD-решения, умеете работать с Docker.
- Работали с кластерными СУБД: Vertica, ClickHouse, Sphinx, Trino и другими.
Работа у нас — это
- Возможность реализовать свои идеи в проекте с многомиллионной аудиторией.
- Команда, которая поддерживает инициативы.
- Оборудование, дополнительные мониторы и всё, что нужно для продуктивной работы.
- Система премий и зарплата, размер которой обсудим на собеседовании.
- Личный бюджет на обучение, который можно тратить на книги, курсы и конференции.
- Забота о здоровье: с первого дня у вас будет ДМС со стоматологией, в офисе принимают терапевт и массажист.
- Удалённый формат работы и комфортный офис в двух минутах от метро «Белорусская»: панорамный вид на центр города, места для уединённой работы и зоны отдыха.

О компании Avito
Avito — самый популярный сайт объявлений в России, классифайд №1 в мире. Месячная аудитория составляет 57,4 млн. — это больше трети населения России. Количество активных объявлений превысило 125 млн. Каждую секунду на “Авито” совершается более восьми сделок. А география сервиса — это вся Россия — от Калининграда до Дальнего Востока.