Закупка Claude — это не enablement: что должно быть готово до старта

Anthropic пишет: к маю 2026 больше 80% кода, вливаемого в их production, авторствовал Claude — это их цифра, не факт из вашей организации. За ней видно главное: закупка лицензий — ещё не enablement. Что должно быть готово до старта и как устроено ревью AI-вывода на три слоя, чтобы demo-grade eval не долетел до прода.

Anthropic публично пишет: к маю 2026 больше 80% кода, который они вливают в свой production codebase, авторствовал Claude (When AI builds itself). Это их цифра и их методология атрибуции — не проверенный факт из вашей организации. Как рыночный сигнал она всё равно заслуживает внимания: лицензии Claude Code наверняка стоят и у вас, а AI там до сих пор используют как умный автокомплит — дописать строчку, сгенерировать тест, ускорить рутину.

Continue reading “Закупка Claude — это не enablement: что должно быть готово до старта”

Как сделать eval критерием релиза AI-фичи, а не оценкой «на демо выглядело нормально»

Demo-grade eval одобряет фичу на тех же примерах, что и питч. Дальше прод показывает длинный хвост. Три слоя — regression из инцидентов, distribution diff к снапшоту, human spot-check — и один named owner. Минимальный harness: github.com/dobryakov/eval-harness.

Сделайте качество AI-вывода release-критерием: фиксированный regression из прошлых инцидентов, distribution-diff к снапшоту прошлого релиза (20–50 реальных входов), human spot-check перед первым продом нового вида вывода — и один человек, который подписывает sign-off. Ниже — антипаттерн demo-grade, три слоя методики и минимальный harness, который падает в CI с понятным exit code.

Continue reading “Как сделать eval критерием релиза AI-фичи, а не оценкой «на демо выглядело нормально»”