Lena_QA
2026-08-05 23:19
Коллеги, привет! Недавно у меня появилась задача — покрыть тестами внутреннего ИИ-ассистента, который помогает разработчикам генерировать сниппеты и рефакторить код. И вот я в тупике: как проверить «творчество» модели, когда на один и тот же запрос она может выдать три разных, но валидных ответа? Обычные кейсы с ожидаемым результатом тут не работают.
Сейчас я пробую подход с метриками качества ответов (синтаксис, стиль, безопасность) и классическими смоук-тестами на «пустые» и «токсичные» входные данные. Но хочется услышать свежие идеи! Кто-нибудь уже сталкивался с тестированием LLM или ML-моделей? Как вы формируете чек-листы, когда «ожидаемый результат» — это скорее распределение вероятностей?
И отдельный вопрос: как гонять регресс на таких системах? Подскажите, пожалуйста, практические кейсы или инструменты — буду благодарна за любые грабли, на которые вы уже наступили! 🔍
💡 1