Прогнозные и скоринговые модели

Строим модели, которые дают числовую оценку для конкретного решения: вероятность оттока клиента, прогноз спроса, оценка риска по заявке, ожидаемый срок выполнения заказа. Начинаем с аудита данных, потому что чаще всего препятствием оказывается не выбор алгоритма, а то, что нужных данных не собирали или собирали неполно.

Коротко о задаче

Запрос на прогнозирование обычно формулируется как «хотим предсказывать». Первый вопрос, который мы задаём: какое решение изменится, если прогноз появится.

Вопрос не риторический. Прогноз, на основании которого никто ничего не делает, стоит денег и не приносит ничего. Прогноз оттока полезен, только если есть, что предложить уходящему клиенту, и есть кому это сделать. Прогноз спроса полезен, если по нему меняется закупка. Если решение принимается одинаково при любом прогнозе, модель не нужна.

Второй вопрос — данные. Модель учится на истории, и история должна быть пригодной: достаточно длинной, полной, с зафиксированным результатом. Именно здесь проекты чаще всего останавливаются. Отток есть, но дата ухода клиента нигде не отмечена. Заявки есть, но исход половины из них неизвестен. Данные за два года есть, но год назад поменяли учётную систему, и старое несопоставимо с новым.

Третье, о чём стоит сказать честно: значительная часть запросов на прогнозирование закрывается не моделью, а хорошим отчётом или наведением порядка в данных. Мы это говорим, а не берём проект ради проекта.

Что входит в услугу

  • Постановка задачи в терминах решения

Определяем, какое действие изменится и как измеряется польза. Без этого невозможно понять, достаточно ли качество модели.

  • Аудит данных

Оцениваем пригодность: глубина истории, полнота, зафиксированы ли результаты, сопоставимы ли периоды, есть ли данные, доступные на момент прогноза, а не задним числом. Результат — честный вывод о выполнимости.

  • Подготовка данных

Сбор из разных систем, сведение, очистка, устранение противоречий. Смотрите {{ссылка: Автоматический контроль качества данных}} и {{ссылка: Миграция и консолидация баз данных}}.

  • Базовое решение для сравнения

Считаем, насколько хорошо задача решается простейшим способом: средним, правилом, текущей практикой. Модель должна выигрывать у этого, иначе она не нужна.

  • Построение и проверка модели

Обучение, подбор признаков, проверка на отложенном по времени периоде. Проверка именно по времени, а не случайной выборкой: иначе модель получает знание из будущего и показывает результат, который не повторится.

  • Объяснимость

Показываем, какие факторы влияют на оценку и почему модель дала такой результат по конкретному случаю. Без объяснения сотрудники не будут ей пользоваться, а в ряде областей объяснимость требуется по закону.

  • Внедрение в процесс

Расчёт по расписанию или по запросу, передача результата в систему, где принимается решение, интерфейс для сотрудника.

  • Контроль деградации

Модели устаревают: меняется рынок, поведение клиентов, ассортимент. Настраиваем измерение фактической точности и уведомление о снижении.

  • Регламент пересмотра

Порядок переобучения и проверки перед выпуском новой версии.

Что это даёт заказчику

  • Ответ о выполнимости заранее. Аудит данных показывает, получится ли, до основных вложений.
  • Сравнение с текущим способом. Видно, выигрывает ли модель у того, как решают сейчас.
  • Объяснимая оценка. Сотрудник понимает, почему цифра такая, и доверяет ей.
  • Проверка честная. Оценка на отложенном периоде, а не на данных, которые модель уже видела.
  • Деградация заметна. Снижение точности обнаруживается измерением, а не по последствиям.
  • Честный отказ. Если задача решается отчётом, мы предложим отчёт.

Как мы работаем

Начинаем с аудита данных. Это относительно короткий этап, который отвечает на главный вопрос и стоит несопоставимо меньше полноценной разработки.

Всегда строим базовое решение для сравнения. Модель, которая работает не лучше простого правила, встречается чаще, чем принято думать, и обнаружить это лучше на второй неделе.

Не берёмся за задачи, где нет данных или где решение не изменится от прогноза. В таких случаях предлагаем начать с накопления нужных данных: через год разговор будет предметным.

Наш опыт

Мы разрабатываем системы, которые собирают и обрабатывают большие потоки данных: платформа фармаконадзора, где накоплено более сорока тысяч обращений и ведётся более десяти тысяч продуктов; платформа с собственным расчётным движком, где логика вычислений задаётся в визуальном конструкторе.

Подход к качеству, который мы применяем к моделям, отработан на системе анализа текстов: измеримые показатели, проверка на закреплённой выборке, порог перед выпуском, отказ от обновления, не прошедшего проверку. Это дисциплина, которая переносится на любую задачу машинного обучения.

Отдельного опубликованного проекта именно по прогнозным моделям у нас нет, и мы говорим об этом прямо. Начинать предлагаем с аудита данных: он даст честный ответ о выполнимости.

Расскажите, какое решение вы хотите принимать иначе и какие данные для этого есть. Начнём с аудита данных.

Давайте создавать вместе!

Свяжитесь с нами и мы проконсультируем по вопросам реализации IT-решений и найдем лучший подход к разработке

Контакты

Офис: г. Казань, ул. Островского, 57Б, оф. 110
Почта: info@nabla-lab.ru
Телефон: +7 (965) 595-62-78