Как активное обучение сохраняет бизнесу деньги и время

Многие компании понимают, какие задачи можно автоматизировать с помощью машинного обучения, но откладывают проекты из-за дорогой подготовки данных. Рассказываем, как активное обучение снижает затраты и ускоряет результат

Об авторе: Валерия Басова, руководитель ИИ-разработки в Embedika.

Компании все чаще сталкиваются с парадоксальной ситуацией: технологии искусственного интеллекта становятся доступнее и мощнее, но многие проекты так и не доходят до промышленного внедрения. Одна из главных причин — подготовка данных. Прежде чем модель сможет решать прикладную задачу, ее необходимо обучить на большом количестве заранее подготовленных примеров правильных ответов.

Подготовка таких примеров называется разметкой данных. Специалисты вручную выделяют в информации то, чему должна научиться модель. Например, юрист отмечает в договоре пункты о сроках исполнения обязательств или передаче прав, врач выделяет важные фрагменты медицинских записей, а сотрудник службы поддержки распределяет обращения клиентов по категориям.

Качество такой работы напрямую влияет на результат работы модели. Именно на примерах система учится находить закономерности, интерпретировать информацию, делать прогнозы и принимать решения в новых ситуациях. Ошибки или несогласованность в разметке могут снижать точность модели и ограничивать ее способность корректно работать с новыми данными.

Особенно дорого подготовка данных обходится в предметных областях, где для разметки необходимы профильные знания. Например, при разработке медицинских ИИ-систем анализировать исследования и выделять значимые признаки могут только врачи, а при создании моделей для анализа юридических документов — юристы. Чем выше стоимость часа работы эксперта и чем больше данных требуется обработать, тем дороже становится обучение модели.

Именно поэтому подготовка данных остается одним из главных факторов, влияющих на стоимость ML-проектов. Помимо самой разметки компаниям необходимо собрать данные, очистить их, привести к единому формату и организовать работу экспертов. По оценкам отрасли, подготовка данных может составлять около 20% бюджета проекта, а в задачах, требующих глубокой предметной экспертизы, достигать половины всех затрат на разработку.

Возникает закономерный вопрос: обязательно ли размечать весь массив данных, чтобы получить качественную модель? Один из подходов, который позволяет существенно сократить объем этой работы, — это активное обучение.

Что такое активное обучение и почему оно позволяет экономить

При традиционном подходе к обучению модели эксперты последовательно размечают большое количество данных. Предполагается, что чем больше примеров увидит модель, тем лучше будет результат. Однако на практике далеко не каждый новый документ приносит одинаковую пользу. Многие примеры похожи друг на друга и практически не улучшают качество модели.

Активное обучение работает иначе. После первоначального обучения и настройки на небольшом наборе размеченных данных модель начинает самостоятельно анализировать новые документы и оценивать, насколько она уверена в своих прогнозах. Если вероятность ошибки небольшая, документ не требует участия эксперта. Если же модель не может однозначно определить правильный ответ, такой пример отправляется на разметку.

Представим систему, которая анализирует договоры и должна находить положения о передаче прав. Большинство документов содержат типовые формулировки, которые модель быстро начинает распознавать самостоятельно. Но если встречается нестандартная юридическая конструкция или неоднозначная формулировка, модель отмечает этот фрагмент как сложный и передает его юристу. После разметки специалистом модель переобучается и уже лучше справляется с похожими случаями в будущем.

Такой подход позволяет отказаться от разметки большого количества однотипных данных, которые практически не влияют на качество модели. Вместо этого ресурсы экспертов концентрируются на наиболее ценных примерах, где их знания действительно повышают точность системы.

В результате компания получает сразу несколько преимуществ. Снижается объем ручной разметки, сокращаются расходы на привлечение профильных специалистов, ускоряется обучение модели и быстрее появляется возможность перейти от пилотного проекта к промышленному внедрению.

Активное обучение на практике

Для проверки эффективности активного обучения мы провели эксперимент на массиве юридических документов. Целью стало обучение модели автоматически выделять юридически значимые положения, включая условия передачи прав, сроки исполнения обязательств и арбитражные оговорки.

Для сравнения использовались два сценария:

в первом документы передавались экспертам на разметку случайным образом; во втором модель самостоятельно выбирала только те примеры, в которых была наименее уверена и которые могли принести наибольшую пользу при дальнейшем обучении.

Результаты показали, что активное обучение позволяет значительно сократить объем работы экспертов. Например, при поиске арбитражных оговорок модель достигала сопоставимого качества после разметки примерно 75 фрагментов текста. При случайном отборе для достижения аналогичного результата потребовалось около 215 примеров.

Аналогичная тенденция наблюдалась и при поиске условий передачи прав. Использование активного обучения позволило получить сопоставимое качество после разметки 415-495 примеров, тогда как при случайном отборе потребовалось около 955. Иными словами, для достижения того же результата экспертам приходилось размечать более чем в два раза меньше данных. Для бизнеса это означает не только снижение прямых расходов, но и существенное сокращение сроков создания первого рабочего прототипа.

Плюсы активного обучения: от количества к качеству

Высокая стоимость подготовки данных остается одной из причин, по которой многие компании ограничиваются пилотными проектами или вовсе отказываются от внедрения ИИ. Если для достижения нужного качества требуется в два-три раза меньше разметки, порог входа заметно снижается. Особенно для среднего бизнеса, который не может позволить себе длительные и дорогостоящие эксперименты.

При этом активное обучение не отменяет необходимости в качественных данных и экспертной разметке. Его основная ценность заключается в другом: оно помогает использовать ресурсы более рационально, направляя усилия специалистов на те данные, которые действительно влияют на качество модели.

По мере усложнения ИИ-проектов стоимость подготовки данных будет только возрастать, а значит, все большее значение будут приобретать подходы, позволяющие получать сопоставимое качество при меньших затратах. Активное обучение — один из таких подходов. Для бизнеса это возможность не только снизить стоимость разработки, но и сделать внедрение ИИ более предсказуемым и экономически оправданным.

➤ Подписывайтесь на телеграм-канал «РБК Трендов» — будьте в курсе последних тенденций в науке, бизнесе, обществе и технологиях.