
Data Scientist / ML Engineer в NLP-направление ML-команды
Компания скрыта (Сфера iGaming)
📍 Весь мир
Удалённо
Специализация
Data Scientist & Machine Learning
Уровень
Middle
Требуемый опыт
3+ лет
Технологии/инструменты
Python
SQL
Apache Airflow
ClickHouse
NLP
LLM
Git
Linux
Формат работы: удалённо из любой точки мира. Компания нанимает специалистов, которые уже переехали из России.
Мы ищем Data Scientist / ML Engineer в NLP-направление нашей ML-команды.
Обязанности
- Разрабатывать и улучшать решения на базе LLM и NLP-моделей.
- Решать задачи классификации, скоринга, extraction и анализа текстовых данных.
- Работать с LLM-as-a-judge.
- Работать с многоязычными данными, в том числе низкоресурсными языками.
- Разрабатывать пайплайны обработки и анализа больших объёмов текстовых данных.
- Формировать и поддерживать validation / evaluation datasets для LLM-моделей.
- Разрабатывать методологию оценки качества LLM: метрики, пороги, error analysis, post-hoc проверки.
- Работать с prompt engineering и системными промптами, уменьшать количество false positive / false negative срабатываний.
- Оптимизировать inference: batching, quantization, использование GPU-ресурсов и скорость обработки.
- Интегрировать модели в production-пайплайны.
- Поддерживать уже работающие модели: мониторинг качества, поиск деградаций и разбор ошибок.
- Работать с неструктурированными данными: текстами, web-контентом, OCR и результатами анализа изображений.
- Проводить эксперименты и доводить успешные исследования до стабильного production-решения.
Требования
- Хорошее знание Python.
- Уверенное знание SQL.
- Практический опыт работы с LLM / NLP.
- Практический опыт работы с VLM / multimodal-моделями.
- Понимание принципов работы Transformer-моделей.
- Опыт работы с open-source LLM: Qwen, Llama, Mistral или аналогами.
- Опыт работы с Hugging Face / Transformers.
- Понимание подходов к prompt engineering.
- Умение строить качественные validation datasets и проводить error analysis.
- Понимание того, почему одной accuracy недостаточно для оценки LLM-систем.
- Опыт работы с классическими NLP-задачами: classification, embeddings, similarity, information extraction.
- Опыт работы с Airflow и построения production ML/data pipelines.
- Опыт работы с ClickHouse.
- Опыт работы с S3-совместимыми хранилищами.
- Умение самостоятельно проводить исследование: от постановки гипотезы и анализа данных до работающего прототипа.
- Способность превращать исследовательский код в воспроизводимое production-решение.
- Git и базовые навыки работы с Linux.
Будет плюсом
- Опыт работы с vLLM.
- Опыт quantization моделей: 4-bit / 8-bit.
- Опыт работы с PyTorch.
- Опыт работы с embedding-моделями и RAG.
- Опыт построения LLM evaluation framework.
- Опыт работы с multilingual NLP.
- Опыт fine-tuning / LoRA / PEFT.
- Опыт работы с OCR.
- Опыт работы с Docker.
- Опыт работы со Slurm.
- Опыт использования GPU-инфраструктуры и понимание особенностей inference больших моделей.

О компании Компания скрыта (Сфера iGaming)
Сфера
Продуктовая компания
Название скрыто под NDA. Международная команда, создающая масштабные продукты в сфере онлайн-развлечений и iGaming для миллионов пользователей по всему миру. Развивает проекты на глобальных рынках, объединяя сильную экспертизу, современные технологии и глубокое понимание индустрии.