Как сделать eval критерием релиза AI-фичи, а не оценкой «на демо выглядело нормально»

Demo-grade eval одобряет фичу на тех же примерах, что и питч. Дальше прод показывает длинный хвост. Три слоя — regression из инцидентов, distribution diff к снапшоту, human spot-check — и один named owner. Минимальный harness: github.com/dobryakov/eval-harness.

Сделайте качество AI-вывода release-критерием: фиксированный regression из прошлых инцидентов, distribution-diff к снапшоту прошлого релиза (20–50 реальных входов), human spot-check перед первым продом нового вида вывода — и один человек, который подписывает sign-off. Ниже — антипаттерн demo-grade, три слоя методики и минимальный harness, который падает в CI с понятным exit code.

Continue reading “Как сделать eval критерием релиза AI-фичи, а не оценкой «на демо выглядело нормально»”