Зелёный статус eval-тестов не гарантирует, что
AI-агент работает правильно. Он может дать верный ответ, но выполнить неверные действия или не выполнить их вовсе.
Авторы
разобрали 7 типичных ошибок, из-за которых
тесты врут. Часто проверяется только финальный результат, а процесс остаётся за кадром.
Агент пропускает нужные шаги, делает лишние или просто угадывает ответ. Такие тесты создают ложное чувство надёжности.
Проверяйте логи и промежуточные шаги, а не только финальный ответ. Это единственный способ увидеть, что агент действительно делает то, что нужно.