Обучить нейросеть на своих данных: что за этим стоит на самом деле
«Обучите её на наших договорах» — эту фразу я слышу почти на каждом первом созвоне. Вместо договоров бывает прайс, переписка менеджеров, база 1С или просто «всё, что у нас есть». Звучит уверенно, и по сути человек прав: он хочет, чтобы система работала с его данными и говорила на его языке. Неточно ровно одно слово. За «обучить» прячутся пять совершенно разных проектов — от вечера работы до бюджета исследовательской лаборатории. От того, какой из них имелся в виду, зависит цена, срок, возможность откатиться назад и, если совсем честно, сам факт результата.
Одно слово, пять разных проектов
Когда заказчик говорит «обучить», он почти всегда имеет в виду одно из трёх желаний. Чтобы система знала наши товары, регламенты и цены. Чтобы она отвечала как наш лучший менеджер, а не как усреднённый вежливый робот. Чтобы наши данные при этом никуда не уходили.
Первое желание закрывается поиском по вашим данным. Третье — тем, где физически стоит система. И только второе иногда действительно требует того, что в отрасли называют дообучением (fine-tuning). Разница здесь не терминологическая. Подмена одного инструмента другим не даёт половинчатого результата — она не даёт никакого, и выясняется это через несколько месяцев.
Проще всего думать о новом сотруднике
Метафора грубая, но она расставляет всё по местам. Промпт — это внятно поставленная задача: объяснили человеку, чего от него хотят, показали пару примеров хорошей работы. Доступ к данным — выдали логин в 1С, ссылку на папку с регламентами и внутренний телефон склада. Дообучение — натаскали на процесс: месяц правили за ним ответы, пока он не стал делать по-нашему. Обучение с нуля — вырастили человека с первого класса.
Никто в здравом уме не растит сотрудника с первого класса ради того, чтобы он правильно оформлял накладные. В разговорах об ИИ это предлагают регулярно.
Ступень первая: инструкция и примеры
Симптом. «Отвечает не то и не так. Слишком общо, льёт воду, придумывает пункты, которых у нас нет».
Что меняем. Постановку задачи. Расписываем роль, границы, формат ответа, что делать при нехватке данных, и кладём рядом пять–десять примеров того, как выглядит хороший ответ. Плюс, если нужна жёсткая структура, задаём её схемой на уровне интерфейса модели, а не уговорами в тексте.
Потолок ступени. Модель по-прежнему не знает ваших цен, остатков и того, что вчера сменился поставщик. И промпт со временем разрастается: сначала полстраницы, потом три экрана правил, накопленных по одному после каждой ошибки.
Сроки. Часы, реже несколько дней. Это самая недооценённая ступень: по нашим проектам она даёт большую часть итогового качества, и почти каждый, кто пришёл с запросом на обучение, её толком не прошёл.
Ступень вторая: доступ к данным и инструментам
Симптом. «Про общие вещи отвечает хорошо, а про наши — выдумывает».
Что меняем. Не саму модель, а то, что лежит у неё перед глазами в момент ответа. Система ищет нужные куски в вашей номенклатуре, договорах, регламентах, выгрузках из 1С — и подставляет найденное в запрос. Механику мы разбирали отдельно в статье «RAG и 1С», здесь достаточно сказать: именно так модель начинает «знать вашу компанию».
Потолок. Отвечает по делу, но своим голосом, а не вашим. Формат гуляет. Если процесс требует единообразия — счёт, карточка, ответ в мессенджере по строгому шаблону, — вы будете допиливать это правилами до бесконечности.
Сроки. Дни и недели. И именно здесь, а не на дообучении, обычно и заканчивается разумный проект.
Важная развилка, по которой видно опытного подрядчика. Когда система ответила неправильно, первым делом смотрят не на модель, а на то, лежал ли вообще правильный документ среди найденного. Лежал — значит, чинить нужно инструкцию и подачу. Не лежал — чинить поиск, и модель тут ни при чём. Если на жалобу «плохо отвечает» вам сразу предлагают дообучение, эту развилку никто не проходил.
Ступень третья: дообучение. Меняем привычки, а не память
Здесь начинается главное недоразумение всей темы, и стоит оно дороже остальных вместе взятых.
Дообучение — это когда мы берём готовую модель и на нескольких сотнях или тысячах ваших примеров смещаем её поведение. Технически сегодня это чаще всего лёгкая надстройка: базовые веса не трогаем, кладём поверх небольшой файл-адаптер, который можно снять и вернуть всё как было. Отсюда, кстати, и разумность метода: он обратим.
Формула, которая экономит месяцы: дообучение задаёт форму, поиск даёт факты. Факт, зашитый в веса, устаревает в ту секунду, когда меняется прайс. Его нельзя проверить, на него нельзя сослаться, его невозможно удалить по запросу — только переобучив всё заново. В поиске запись просто убирается из индекса, и на этом история заканчивается.
Это не наше наблюдение по паре проектов, это измерено. В работе, представленной на конференции EMNLP в 2024 году, показали неприятную вещь: примеры с фактами, которых модель раньше не встречала, усваиваются медленнее прочих, а по мере того как она их всё-таки заучивает, склонность выдумывать растёт. То есть попытка «дообучить, чтобы знала» бьёт ровно по тому, ради чего затевалась. Знания модель получает на предобучении; дообучение учит ими пользоваться.
Что даёт дообучение на практике: модель держит тон и формат без напоминаний в промпте, не съезжает с инструкции к концу длинного диалога, разбирает грязный вход на поля без уговоров и умеет промолчать и передать человеку, когда не уверена. И ещё одна вещь, о которой редко говорят вслух: оно про деньги, а не про ум. Маленькая модель, дообученная на ответах большой, работает быстрее и стоит в разы дешевле — вот это окупается. Разросшийся до трёх экранов промпт, за который вы платите в каждом запросе, сворачивается в поведение модели — это тоже окупается. Всё остальное обычно про контроль и приватность, а не про экономию.
Ступени четвёртая и пятая: то, чего почти никогда не нужно
Продолженное предобучение — это когда модель дочитывает большой корпус текстов вашей отрасли, чтобы освоить её язык целиком. Имеет смысл там, где отраслевой язык действительно чужой для обычной модели: узкая медицина, специфическое право, редкая инженерия. Месяцы, серьёзные данные, серьёзные деньги.
Обучение с нуля — отдельная планета. Чтобы масштаб был осязаем: на один финальный прогон DeepSeek-V3, одной из самых известных открытых моделей, ушло порядка 2,8 миллиона часов работы серверных видеокарт. В деньгах сами разработчики оценили это примерно в 5,6 миллиона долларов и в том же отчёте оговорились, что считали один удачный прогон: без предшествовавших исследований, без сбора данных и без десятков неудачных попыток. Независимые аналитики спорили и с этой суммой: если считать вместе с железом и людьми, счёт идёт на сотни миллионов.
Поэтому, когда вы слышите «мы обучили свою модель», в девяти случаях из десяти это значит: взяли чужие открытые веса, положили сверху свой адаптер, обучили его на своих данных и развернули в своём контуре. Это нормальная, честная и полезная работа. Просто называется она иначе.
Как выбрать ступень за пять минут
Четыре вопроса, которые мы задаём на первом созвоне. Они дешевле любого пилота.
- Ответ зависит от того, что изменилось на этой неделе? Если да — вам нужен поиск по данным, и никакое обучение эту задачу не решит.
- Можете показать полсотни примеров, где готовая модель ошибается, и рядом написать правильный ответ? Если нет — рано. Не потому что мы вредничаем, а потому что без этого невозможно доказать, что стало лучше.
- Сколько стоит одна ошибка? Если неверно названная цена или срок поставки — это претензия и потерянный клиент, начинать надо не с точности, а с умения отказываться и передавать человеку.
- Кто внутри компании будет владеть этим через год? Модели обновляются, формы документов меняются, ассортимент растёт. Нет живого человека с фамилией — не начинайте.
Где мы обычно останавливаемся
Теперь неудобная часть. Мы отговариваем от дообучения чаще, чем берёмся за него, и вот признаки, по которым решение принимается почти сразу.
- Вы хотите зашить в модель сами факты — цены, остатки, сроки. Это не лечится дообучением ни при какой частоте обновления: манеру ответа дообучить можно, факты всё равно придут из поиска.
- Примеров меньше пары сотен, и взять их негде.
- Никто не может сформулировать, что считать успехом, в проверяемом виде.
- Нужна ссылка на источник — «откуда ты это взял». Веса такой ссылки не дают.
- Поток обращений маленький. Оптимизировать цену запросов, которых десять в день, — это хобби, а не проект.
- Базовая модель ещё не проверена на нормальном промпте с примерами. Сначала пройдите первую ступень.
И ещё одно наблюдение, из-за которого проекты замирают чаще, чем из-за техники. Заказчик хочет, «чтобы отвечала как наш лучший менеджер». А лучший менеджер — самый занятой человек в компании, и двух дней на разбор примеров у него нет. Ни одна технология эту проблему не решает.
Мы берёмся за дообучение примерно в двух случаях из десяти. В остальных восьми говорим, что задача решается дешевле — и объясняем, чем именно.
Кстати, отраслевая статистика тут не про то, что ИИ не работает. Gartner ещё в 2024 году прогнозировал, что не меньше 30% проектов с генеративным ИИ бросят после пилота, и называл четыре причины: плохие данные, слабый контроль рисков, растущие расходы и неясная польза для бизнеса. Пятую добавлю от себя, по нашим проектам она самая частая: у внедрения нет живого владельца. Ни одна из пяти не про саму модель — и всё это лечится на берегу, если не торопиться сразу к третьей ступени.
Про то, как дообучение выглядит изнутри — куда уходят недели и рубли, что ломается и что остаётся у заказчика на руках, — во второй части.
Не уверены, какая ступень ваша?
Пройдём четыре вопроса из статьи по вашей задаче и скажем прямо: хватит промпта и поиска по данным или действительно нужно дообучение. Разговор бесплатный, и мы не обидимся, если ответ будет «вам это не нужно».