
Инженер данных в DWH Лавки — RT/NRT и AI‑агенты
в Яндекс Foodtech
Технологии/инструменты
Команда DWH Лавки работает над хранилищем, которое поддерживает аналитику и ключевые операционные процессы бизнеса.
В основе хранилища — зрелый batch‑контур. Он включает тысячи расчётов и зависимостей: сохраняет историю и предоставляет проверенные данные за прошедший день.
Сейчас мы развиваем направление RT/NRT‑данных для AI‑систем Лавки. Речь идёт о потоковых и микробатчевых поставках, единых контрактах и контроле качества. Оперативные данные позволяют быстро получать сигналы и контекст для принятия решений, а batch‑слой обеспечивает полноту данных, сохраняет историю и финальную версию информации. Нам требуется опытный инженер данных. Его задача — связать эти контуры и развить платформенную основу для AI‑продуктов, которые используют операционные и управленческие команды.
Роль инженерная, с полной ответственностью за результат. Нужно самостоятельно выбирать задачи, в которых RT/NRT‑данные будут действительно полезны, проектировать решения, запускать их в промышленную эксплуатацию и развивать вместе с продуктовыми командами.
Мы работаем со следующим стеком технологий:
- Python, SQL и YQL
- Внутренний Code Driven фреймворк DMP Suite
- YT, Greenplum и ClickHouse
- Apache Flink / Flink Flow и LogBroker для потоковой обработки
- Встроенные инструменты Data Quality, мониторинга и управления ETL‑процессами
Какие задачи вас ждут
- Развитие поставок данных. Вы будете проектировать и развивать RT/NRT‑поставки данных для разных сценариев работы продуктовых команд — например, для жизненного цикла заказа, работы сотрудников, складских операций и отслеживания доступности товаров. При этом нужно тщательно продумать, как будут взаимодействовать оперативный и batch‑контуры, и подобрать архитектуру, которая обеспечит нужную скорость, полноту, стоимость и надёжность данных.
- Проектирование RT‑данных. Вам предстоит помогать системным аналитикам и продуктовым командам проектировать RT‑данные: подбирать источники и способы обработки, определять модель событий, контракты, требования к свежести и качеству данных, а также прорабатывать правила работы с запаздывающими событиями и предварительными результатами.
- Поиск возможностей по RT‑данным. Вам нужно будет искать новые способы работы с RT‑данными, разрабатывать универсальные подходы и помогать внутренним заказчикам разобраться, какие задачи можно решить с их помощью. При этом проектирование прикладных агентов и бизнес‑сценариев останется за продуктовыми командами.
- Инженерные задачи и развитие DWH. В ваши обязанности войдёт ведение инженерных задач: исследование процессов и источников данных, запуск решений в промышленную эксплуатацию, контролирование их работы и безопасное развитие DWH, который имеет большой граф зависимостей.
- Развитие AI‑агентов для DWH. Вы будете расширять возможности AI‑агентов в автономном DWH: предоставлять им качественный контекст и инструменты, устанавливать ограничения и проверки, оценивать результаты работы и превращать сложные случаи в новые сценарии автоматизации. Также вам предстоит работать с нетиповыми инцидентами — выявлять их системные причины и на этой основе создавать новые проверки, инструменты и возможности для агентов.
Мы ждём, что вы
- Проектировали и поддерживали промышленные RT/NRT‑пайплайны, понимаете, чем их разработка и эксплуатация отличаются от batch‑обработки.
- Занимались разработкой в крупном DWH или распределённой платформе, понимаете, как безопасно менять процессы с большим графом зависимостей.
- Умеете проектировать надёжную обработку событийных данных с учётом задержек, повторной обработки и изменений источников.
- Уверенно владеете Python и SQL, понимаете принципы моделирования данных, качества, наблюдаемости и надёжной эксплуатации.
- Умеете превращать не до конца сформулированную бизнес‑задачу в модель данных и техническое решение, сравнивать архитектурные варианты, объяснять компромиссы и договариваться с владельцами источников.
- Уже используете AI‑агентов в инженерной работе и хотите развивать подход, в котором человек управляет целями, качеством и архитектурой, а значительную часть реализации и поддержки выполняют агенты.
- Готовы брать ответственность за результат поставки данных, а не только за написанный код.
Будет плюсом, если вы
- Имели глубокий практический опыт работы с Apache Flink.
- Практиковали построение lambda‑ или kappa‑архитектуры и объединение оперативного и batch‑контуров.
- Запускали новое платформенное направление или развивали внутренние data‑продукты.
- Практиковали проектирование data contracts и интеграцию нескольких продуктовых систем.
- Разрабатывали инструменты, контекст, проверки или evaluation‑процессы для инженерных AI‑агентов.

О компании Яндекс Foodtech
Яндекс Foodtech — сервис, который решает любые вопросы пользователей, связанные с едой: от заказа продуктов из супермаркетов до доставки блюд из ресторанов. Каждый месяц Яндекс Едой пользуется 15 млн пользователей в более чем 400 городах.