выше рынкамедиана по похожим ролям (28) — 182 500 RUB
Опубликовано 5 дн назад
SQLPythonMLLLM
живостьживаяпо истории наблюдений за вакансией
очередьданных мало
QA (ML/LLM) в компанию Цифровые привычки
Проект Сбера по развитию и тестированию ML/LLM-систем в компании Цифровые привычки.
📝 Обязанности
Выстроить систему оценки качества ответов LLM-агентов (SQL-агент, агент анализа, агент визуализации): метрики, критерии, процесс;
Развивать и сопровождать тестовые корзины для регрессионного тестирования: эталонные вопросы, ожидаемые SQL-запросы и ответы;
Автоматизировать прогон тестов и оценку по бинарным критериям (валидность JSON, исполнимость SQL, отсутствие галлюцинаций, корректность ролевого доступа, консистентность ответов), в том числе через LLM Judge;
Проводить сравнительное тестирование моделей и версий промптов, готовить отчёты для принятия решений;
Тестировать релизы перед выводом в пром, выявлять расхождения поведения между тестовым и промышленным контурами;
Анализировать инциденты качества в проме, локализовывать причины (промпт / модель / данные / код).
🔍 Требования
Опыт QA от 3 лет, из них опыт тестирования ML/LLM-систем;
Уверенный SQL (у нас GreenPlum) — умение читать и проверять чужие запросы, находить логические ошибки;
Python для автоматизации тестов и обработки результатов;
Понимание специфики LLM: недетерминированность, галлюцинации, чувствительность к промптам.
💎 Будет преимуществом
Опыт работы с фреймворками оценки LLM (Ragas, DeepEval) или построения своих;
Опыт с LangChain/LangGraph;
Знание банковской предметной области, финансовой отчётности (P&L);
Опыт тестирования data-продуктов: витрины, ETL, качество данных.
🕹 Условия
Трудоустройство: ИП или ГПХ;
Зарплата: от 200 000 ₽ до 250 000 ₽;
Формат работы: первые 3 месяца офис, далее гибрид (офис в Москве);
Локация: Москва.
📞 Контакты
- Telegram: @ithrevgenya
@QA_rabota