Валидация систем с искусственным интеллектом в регулируемых отраслях
Валидируем системы с компонентом машинного обучения там, где действуют требования надлежащих практик: определяем метрики приёмки, закрепляем проверочную выборку, устанавливаем порог выпуска, описываем управление обновлениями модели и роль человека в принятии решения. Мы валидируем компьютеризированные системы по GAMP 5 и одновременно разрабатываем системы с языковыми моделями — сочетание, которое встречается редко.
Коротко о задаче
Валидация построена на предположении, которое ИИ нарушает. Предполагается, что система детерминирована: при одних и тех же входных данных она даёт один и тот же результат, и его можно зафиксировать протоколом.
Модель машинного обучения ведёт себя иначе. Она даёт вероятностный результат, ошибается на части случаев по своей природе, а после обновления начинает вести себя по-другому на входных данных, которые не менялись. Классический протокол испытаний, где записан ожидаемый результат по каждому шагу, к ней неприменим.
Отсюда две крайности, обе плохие.
Первая: систему с ИИ не валидируют вовсе, потому что непонятно как. Она работает в GxP-контуре без документального подтверждения, и это обнаруживается на инспекции.
Вторая: её валидируют как обычное программное обеспечение. Протоколы подписаны, а через полгода модель обновили, и валидированное состояние перестало существовать, чего никто не заметил, потому что процедуры управления изменениями для модели не было.
Работающий подход другой. Валидируется не безошибочность модели, а система вокруг неё: измеримые требования к качеству, воспроизводимая процедура проверки, контроль обновлений, прослеживаемость решений и роль человека там, где цена ошибки высока.
Что входит в услугу
- Определение GxP-критичности и роли ИИ
Устанавливаем, на что влияет система и какова роль модели: советующая, когда решение принимает человек, или решающая. От этого зависит весь объём дальнейшей работы. Смотрите {{ссылка: Валидация компьютеризированных систем по GAMP 5}}.
- Требования и спецификации для компонента с ИИ
Описываем, что именно должна делать модель, на каких данных, с какими ограничениями применимости и что находится за границей её задачи.
- Метрики приёмки
Задаём измеримые критерии: минимальная точность, минимальная полнота, требования к корректности формата ответа, допустимая доля случаев, передаваемых человеку. Числа определяются рисками, а не удобством.
- Закреплённая проверочная выборка
Формируем и запираем выборку, на которой проверяется каждая версия. Она не используется при настройке и не меняется произвольно, иначе результаты проверок несопоставимы между версиями.
- Порог выпуска
Формализуем требования, которым обязана удовлетворять новая версия перед выводом в работу. Не прошла — не выпускается, независимо от того, насколько хорошо выглядит на отдельных примерах.
- Проверка на сложных примерах
Отдельный набор случаев, на которых модель ошибалась или может ошибиться, с требованием отсутствия критических провалов.
- Протоколы квалификации применительно к модели
Установка и конфигурация модели и окружения, проверка функционирования на закреплённой выборке, проверка работы на реальных данных с участием пользователей. Смотрите {{ссылка: Квалификация IT-инфраструктуры: DQ, IQ, OQ, PQ}}.
- Управление изменениями модели
Регламент: что считается изменением, требующим повторной проверки, в каком объёме, кто утверждает, как документируется. Обновление модели относится к изменениям, влияющим на валидированное состояние.
- Прослеживаемость решений
Журналирование входных данных, результата, уверенности и обоснования по каждому обращению к модели. При разборе должно быть возможно восстановить, что и почему система решила. Смотрите {{ссылка: Целостность данных и аудиторский след: ALCOA+, Data Integrity}}.
- Контроль дрейфа
Измерение фактического качества в эксплуатации и уведомление при снижении. Модель может деградировать без изменения кода, просто потому что изменились входные данные.
- Роль человека в контуре
Описание и обоснование того, где решение остаётся за человеком, как оформляется несогласие с моделью и что происходит с такими случаями дальше.
Что это даёт заказчику
- Систему с ИИ можно предъявить. Пакет документов отвечает на вопросы инспектора.
- Обновление не обнуляет валидацию. Управление изменениями модели описано и работает.
- Качество измеримо и воспроизводимо. Проверка на закреплённой выборке сопоставима между версиями.
- Решения прослеживаются. По каждому случаю видно, что и на каком основании система выдала.
- Деградация обнаруживается. Контроль дрейфа показывает снижение до того, как оно скажется.
- Разработчик и валидатор в одном лице. Не нужно объяснять внешнему консультанту, как устроена модель.
Как мы работаем
Начинаем с определения роли модели. Советующая система, где человек принимает решение и может не согласиться, и решающая система, где вывод модели применяется автоматически, требуют принципиально разного объёма проверок.
Метрики приёмки задаём от риска. Требование к полноте в задаче, где пропуск означает несообщение регулятору, и в задаче, где пропуск означает лишнюю ручную проверку, отличается кардинально.
Проверочную выборку закрепляем до начала настройки. Выборка, которую видели при подборе параметров, перестаёт быть проверкой.
Наш опыт
Мы валидируем компьютеризированные системы по GAMP 5: на системах нашей разработки заказчики прошли более тридцати аудитов клиентов и более десяти проверок регуляторов. Полный пакет — требования пользователя, спецификации, анализ рисков, протоколы квалификации, отчёт о валидации — мы готовим сами.
Одновременно мы разработали и сопровождаем систему с локально развёрнутой языковой моделью, работающую в отрасли с регуляторными требованиями. Для этой части проекта у нас действует режим, привычный скорее для исследований: закреплённая проверочная выборка, заранее заданные требования к точности, полноте и корректности формата ответа, отсутствие критических провалов на сложных примерах как условие выпуска. Кандидат на обновление, не прошедший порог, не выкатывается, каким бы хорошим он ни выглядел на отдельных примерах.
Модель возвращает по каждому случаю вердикт, уверенность и фрагмент-обоснование. Это одновременно и удобство для сотрудника, и материал для разбора при проверке.
Расскажите, какая система у вас работает или планируется и какие требования к вам применимы. Начнём с определения роли модели и объёма валидации.
Давайте создавать вместе!
Свяжитесь с нами и мы проконсультируем по вопросам реализации IT-решений и найдем лучший подход к разработке
Контакты
Офис: г. Казань, ул. Островского, 57Б, оф. 110
Почта: info@nabla-lab.ru
Телефон: +7 (965) 595-62-78