AI Quality, Drift & Fairness: как модель не деградирует после апдейта и не дискриминирует при скоринге

Тихая деградация — самый частый способ потерять качество ИИ-системы без единого деплоя. Continuous evaluation, LLM-as-judge и fairness-тесты как гейт релиза.

AI Quality, Drift & Fairness: как модель не деградирует после апдейта и не дискриминирует при скоринге

Провайдер незаметно обновил базовую модель. Формально API тот же, версия — та же строка, но поведение сместилось: «Ковчег» стал чуть чаще выдумывать условия, которых нет в документах, и чуть строже относиться к заявкам из одного региона. Никто ничего не менял в коде. Через месяц это всплывает как рост жалоб и вопрос от комплаенс: «Почему одобрений по региону N стало меньше?» Так выглядит тихая деградация — самый частый способ, которым качество ИИ-системы уходит без единого деплоя.

Эта глава — про quality plane: гарантию, что модель не деградирует со временем (drift), ответы остаются точными при обновлении базовых LLM, а решения не дискриминируют (bias). Для «Ковчега» предвзятость в скоринге — не метрика в дашборде, а прямое нарушение AI Act (Art. 10 — качество данных, недискриминация) и юридический иск.

Бизнес-цена

Качество и справедливость решений «Ковчега» измеримы, отслеживаются непрерывно и являются гейтом релиза. Обещания бизнесу:

  1. Апдейт модели не выходит в прод без прохождения регрессии на эталонах.
  2. Деградация и дрейф ловятся мониторингом, а не жалобами.
  3. Отсутствие демографической предвзятости в скоринге доказуемо.

Драйверы жёсткие. Silent degradation: обновление модели «под капотом» проваливает качество незаметно. EU AI Act (high-risk): Art. 10 (data quality, недискриминация), Art. 15 (accuracy, robustness), Art. 14 (human oversight). Bias: систематически худшие решения для группы — иск, штраф, репутация. OWASP LLM: LLM09 (Misinformation) — галлюцинации как класс.

Архитектурный паттерн: Continuous Evaluation & LLM-as-a-Judge Pipeline

Оценка — непрерывный процесс: регрессия на golden-датасетах в CI/CD + онлайн-метрики RAG + дрейф-мониторинг + fairness-тесты, с честной калибровкой судьи.

Инженерный стек:

  • Eval-фреймворки: Ragas (v0.2+ — уже не только RAG, но и агентные пайплайны), DeepEval, TruLens, MLflow (эксперименты/реестр).
  • Drift/data-quality: Evidently AI, Great Expectations.
  • Judge: LLM-as-a-judge с калибровкой на человеческой разметке.

Шаг 1. Golden Datasets

Эталонные наборы под регрессию промптов и моделей в CI/CD. Апдейт модели или промпта не проходит без прогона. Датасет включает «трудные» кейсы и кейсы из реальных инцидентов.

Шаг 2. Онлайн RAG-метрики

На выборке продакшн-трафика: Faithfulness (достоверность к контексту — прямая защита от галлюцинаций), Answer Relevance, Context Recall/Precision. Стыкуется с output-guardrail (гл. 3) — там блок в реальном времени, здесь тренд.

Шаг 3. Drift-мониторинг

Аномалии в распределении эмбеддингов входящих запросов (data drift) и в качестве ответов (concept drift). Смещение — алерт. Семантический кэш (гл. 5) маскирует дрейф — мерить на некэшированной выборке.

Шаг 4. Fairness & Bias

Регулярный прогон синтетических тестов: перестановка защищённых атрибутов (пол, возраст, регион) при прочих равных — сравнение решений. Систематическая разница — сигнал bias. Для «Ковчега» это обязательный гейт кредитного модуля.

Шаг 5. Eval-гейт релиза

Метрики — часть пайплайна (policy-as-code, гл. 6). Падение ниже порога блокирует деплой:

eval_gate:
  faithfulness:      {min: 0.92}
  answer_relevance:  {min: 0.85}
  fairness_delta:    {max: 0.03}   # макс. разница решений при перестановке атрибута
  block_release_on_fail: true

Где ломается

LLM-as-judge сам предвзят и недетерминирован. Документированные искажения: verbosity bias (длиннее = «лучше»), self-preference (хвалит свой стиль), position bias (порядок вариантов). Митигация: рандомизация порядка, чёткие рубрики, ensemble судей, человеческая golden-разметка. Без калибровки это «оценка оценки».

Калибровка дрейфует. Согласие judge с людьми, солидное полгода назад, устаревает — промпты, данные, версии моделей меняются. Рекалибровка — регулярный процесс, не разовый.

Golden-датасет устаревает. Не покрывает новые кейсы — зелёные метрики при реальной деградации. Датасет пополняется из инцидентов и продакшн-трафика.

Fairness труднометрим. «Справедливость» контекстна; несколько формальных метрик fairness математически несовместимы одновременно — выбор метрики сам требует обоснования.

Стоимость. Непрерывная judge-оценка дорога; сэмплирование vs полнота — компромисс.

Стандарты и маппинг

  • EU AI Act: Art. 10 (data governance/quality, недискриминация), Art. 15 (accuracy/robustness), Art. 14 (human oversight).
  • ISO/IEC 42001: мониторинг производительности, непрерывное улучшение.
  • NIST AI RMF: Measure (valid, reliable, fair, safe).
  • OWASP LLM: LLM09 (Misinformation).

Лаба и артефакт

Собрать golden-датасет для «Ковчега» (в т.ч. кейсы-инциденты), настроить Ragas-метрики онлайн, Evidently для эмбеддинг-дрейфа на некэшированной выборке, fairness-тест перестановкой атрибутов для кредитного модуля; сделать eval-гейт в CI; откалибровать judge на человеческой разметке и замерить agreement. Артефакт: eval-suite + дашборд качества/дрейфа + fairness-отчёт + отчёт калибровки судьи (доказательство в RMS, гл. 6).

Чеклист зрелости

  • L1: ручная проверка качества при апдейте.
  • L2: golden-датасет + RAG-метрики онлайн, drift-алерты.
  • L3: eval-гейт в CI, калиброванный judge с рекалибровкой, регулярные fairness-прогоны, дрейф на некэшированной выборке, связка с RMS (гл. 6).

Источники


Полный howto: https://www.dobryakov.com/howto/ai-governance-quality-drift-fairness.html

Если ваш следующий апдейт модели выйдет в прод без eval-гейта — вы узнаете об этом от юристов.

Leave a Reply

Your email address will not be published. Required fields are marked *