Спикеры

Даниил Садчиков

Sber AI Lab · AI engineer

Почему ИИ-агент галлюцинирует и как это померить до релиза

Галлюцинации — не баг, который чинится одним удачным промптом. Это свойство модели, с которым нужно научиться работать инженерно: измерять, ставить пороги и ловить регрессии до того, как их найдёт пользователь. В докладе разберу, откуда на самом деле берутся ошибки ИИ-агента: сгаллюцинировала LLM, retrieval вернул не тот документ, противоречия в промпте или ошибка в архитектуре. Для каждого случая свой способ детекции, и путать их дорого. Расскажу про eval-подходы, которые использую в своих проектах. Разберем где LLM-as-judge работает, а где врёт, какие пороги качества имеет смысл сделать блокирующими для релиза. 
Рассмотрим реальные кейсы Отвечу на вопросы: какие метрики считать, как собрать первый набор тестов за ограниченное количество дней и как понять, что агент стал хуже, не дожидаясь жалоб от пользователей. Доклад будет полезен разработчикам и аналитикам, которые уже внедряют LLM в продукт, и тимлидам, которым нужно принимать решение о выкатке на основе цифр, а не ощущений.

ХАРДЫиитестированиемашинное обучение