В приложении удобнее
Установить
Компания скрыта (Сфера iGaming)

Data Scientist / ML Engineer в NLP-направление ML-команды

Компания скрыта (Сфера iGaming)

📍 Весь мир
Удалённо
Специализация
Data Scientist & Machine Learning
Уровень
Middle
Требуемый опыт
3+ лет

Технологии/инструменты

Python
SQL
Apache Airflow
ClickHouse
NLP
LLM
Git
Linux

Формат работы: удалённо из любой точки мира. Компания нанимает специалистов, которые уже переехали из России.

Мы ищем Data Scientist / ML Engineer в NLP-направление нашей ML-команды.

Обязанности

  • Разрабатывать и улучшать решения на базе LLM и NLP-моделей.
  • Решать задачи классификации, скоринга, extraction и анализа текстовых данных.
  • Работать с LLM-as-a-judge.
  • Работать с многоязычными данными, в том числе низкоресурсными языками.
  • Разрабатывать пайплайны обработки и анализа больших объёмов текстовых данных.
  • Формировать и поддерживать validation / evaluation datasets для LLM-моделей.
  • Разрабатывать методологию оценки качества LLM: метрики, пороги, error analysis, post-hoc проверки.
  • Работать с prompt engineering и системными промптами, уменьшать количество false positive / false negative срабатываний.
  • Оптимизировать inference: batching, quantization, использование GPU-ресурсов и скорость обработки.
  • Интегрировать модели в production-пайплайны.
  • Поддерживать уже работающие модели: мониторинг качества, поиск деградаций и разбор ошибок.
  • Работать с неструктурированными данными: текстами, web-контентом, OCR и результатами анализа изображений.
  • Проводить эксперименты и доводить успешные исследования до стабильного production-решения.

Требования

  • Хорошее знание Python.
  • Уверенное знание SQL.
  • Практический опыт работы с LLM / NLP.
  • Практический опыт работы с VLM / multimodal-моделями.
  • Понимание принципов работы Transformer-моделей.
  • Опыт работы с open-source LLM: Qwen, Llama, Mistral или аналогами.
  • Опыт работы с Hugging Face / Transformers.
  • Понимание подходов к prompt engineering.
  • Умение строить качественные validation datasets и проводить error analysis.
  • Понимание того, почему одной accuracy недостаточно для оценки LLM-систем.
  • Опыт работы с классическими NLP-задачами: classification, embeddings, similarity, information extraction.
  • Опыт работы с Airflow и построения production ML/data pipelines.
  • Опыт работы с ClickHouse.
  • Опыт работы с S3-совместимыми хранилищами.
  • Умение самостоятельно проводить исследование: от постановки гипотезы и анализа данных до работающего прототипа.
  • Способность превращать исследовательский код в воспроизводимое production-решение.
  • Git и базовые навыки работы с Linux.

Будет плюсом

  • Опыт работы с vLLM.
  • Опыт quantization моделей: 4-bit / 8-bit.
  • Опыт работы с PyTorch.
  • Опыт работы с embedding-моделями и RAG.
  • Опыт построения LLM evaluation framework.
  • Опыт работы с multilingual NLP.
  • Опыт fine-tuning / LoRA / PEFT.
  • Опыт работы с OCR.
  • Опыт работы с Docker.
  • Опыт работы со Slurm.
  • Опыт использования GPU-инфраструктуры и понимание особенностей inference больших моделей.
Компания скрыта (Сфера iGaming)

О компании Компания скрыта (Сфера iGaming)

Сфера
Продуктовая компания

Название скрыто под NDA. Международная команда, создающая масштабные продукты в сфере онлайн-развлечений и iGaming для миллионов пользователей по всему миру. Развивает проекты на глобальных рынках, объединяя сильную экспертизу, современные технологии и глубокое понимание индустрии.