Обучить нейросеть на своих данных: что за этим стоит на самом деле

«Обучите её на наших договорах» — эту фразу я слышу почти на каждом первом созвоне. Вместо договоров бывает прайс, переписка менеджеров, база 1С или просто «всё, что у нас есть». Звучит уверенно, и по сути человек прав: он хочет, чтобы система работала с его данными и говорила на его языке. Неточно ровно одно слово. За «обучить» прячутся пять совершенно разных проектов — от вечера работы до бюджета исследовательской лаборатории. От того, какой из них имелся в виду, зависит цена, срок, возможность откатиться назад и, если совсем честно, сам факт результата.

Одно слово, пять разных проектов

Когда заказчик говорит «обучить», он почти всегда имеет в виду одно из трёх желаний. Чтобы система знала наши товары, регламенты и цены. Чтобы она отвечала как наш лучший менеджер, а не как усреднённый вежливый робот. Чтобы наши данные при этом никуда не уходили.

Первое желание закрывается поиском по вашим данным. Третье — тем, где физически стоит система. И только второе иногда действительно требует того, что в отрасли называют дообучением (fine-tuning). Разница здесь не терминологическая. Подмена одного инструмента другим не даёт половинчатого результата — она не даёт никакого, и выясняется это через несколько месяцев.

Проще всего думать о новом сотруднике

Метафора грубая, но она расставляет всё по местам. Промпт — это внятно поставленная задача: объяснили человеку, чего от него хотят, показали пару примеров хорошей работы. Доступ к данным — выдали логин в 1С, ссылку на папку с регламентами и внутренний телефон склада. Дообучение — натаскали на процесс: месяц правили за ним ответы, пока он не стал делать по-нашему. Обучение с нуля — вырастили человека с первого класса.

Никто в здравом уме не растит сотрудника с первого класса ради того, чтобы он правильно оформлял накладные. В разговорах об ИИ это предлагают регулярно.

Инструкцияи примеры Доступ к данными инструментам Дообучениемодели Продолженноепредобучение Своя модельс нуля часы дни недели месяцы год и больше меняем формулировку меняем, что видит меняем поведение меняем язык отрасли меняем всё Дальше малому и среднему бизнесу почти никогда не нужно стоимость, срок и необратимость растут
Лестница вмешательств. Чем правее, тем дороже, дольше и труднее откатиться назад. Подавляющее большинство задач закрывается первыми двумя ступенями.

Ступень первая: инструкция и примеры

Симптом. «Отвечает не то и не так. Слишком общо, льёт воду, придумывает пункты, которых у нас нет».

Что меняем. Постановку задачи. Расписываем роль, границы, формат ответа, что делать при нехватке данных, и кладём рядом пять–десять примеров того, как выглядит хороший ответ. Плюс, если нужна жёсткая структура, задаём её схемой на уровне интерфейса модели, а не уговорами в тексте.

Потолок ступени. Модель по-прежнему не знает ваших цен, остатков и того, что вчера сменился поставщик. И промпт со временем разрастается: сначала полстраницы, потом три экрана правил, накопленных по одному после каждой ошибки.

Сроки. Часы, реже несколько дней. Это самая недооценённая ступень: по нашим проектам она даёт большую часть итогового качества, и почти каждый, кто пришёл с запросом на обучение, её толком не прошёл.

Ступень вторая: доступ к данным и инструментам

Симптом. «Про общие вещи отвечает хорошо, а про наши — выдумывает».

Что меняем. Не саму модель, а то, что лежит у неё перед глазами в момент ответа. Система ищет нужные куски в вашей номенклатуре, договорах, регламентах, выгрузках из 1С — и подставляет найденное в запрос. Механику мы разбирали отдельно в статье «RAG и 1С», здесь достаточно сказать: именно так модель начинает «знать вашу компанию».

Потолок. Отвечает по делу, но своим голосом, а не вашим. Формат гуляет. Если процесс требует единообразия — счёт, карточка, ответ в мессенджере по строгому шаблону, — вы будете допиливать это правилами до бесконечности.

Сроки. Дни и недели. И именно здесь, а не на дообучении, обычно и заканчивается разумный проект.

Важная развилка, по которой видно опытного подрядчика. Когда система ответила неправильно, первым делом смотрят не на модель, а на то, лежал ли вообще правильный документ среди найденного. Лежал — значит, чинить нужно инструкцию и подачу. Не лежал — чинить поиск, и модель тут ни при чём. Если на жалобу «плохо отвечает» вам сразу предлагают дообучение, эту развилку никто не проходил.

Ступень третья: дообучение. Меняем привычки, а не память

Здесь начинается главное недоразумение всей темы, и стоит оно дороже остальных вместе взятых.

Дообучение — это когда мы берём готовую модель и на нескольких сотнях или тысячах ваших примеров смещаем её поведение. Технически сегодня это чаще всего лёгкая надстройка: базовые веса не трогаем, кладём поверх небольшой файл-адаптер, который можно снять и вернуть всё как было. Отсюда, кстати, и разумность метода: он обратим.

Формула, которая экономит месяцы: дообучение задаёт форму, поиск даёт факты. Факт, зашитый в веса, устаревает в ту секунду, когда меняется прайс. Его нельзя проверить, на него нельзя сослаться, его невозможно удалить по запросу — только переобучив всё заново. В поиске запись просто убирается из индекса, и на этом история заканчивается.

Это не наше наблюдение по паре проектов, это измерено. В работе, представленной на конференции EMNLP в 2024 году, показали неприятную вещь: примеры с фактами, которых модель раньше не встречала, усваиваются медленнее прочих, а по мере того как она их всё-таки заучивает, склонность выдумывать растёт. То есть попытка «дообучить, чтобы знала» бьёт ровно по тому, ради чего затевалась. Знания модель получает на предобучении; дообучение учит ими пользоваться.

Дообучение меняет И не меняет тон и манеру разговора формат и структуру ответа язык вашей отрасли следование инструкции в диалоге поведение, когда данных нет длину промпта, а с ней цену скорость ответа остатки, цены, сроки свежесть ваших данных права доступа сотрудников факты о клиентах и сделках ссылку на источник ответа Всё это — работа поиска по вашим данным.
Знания приходят через поиск, поведение — через дообучение. Эти две вещи путают чаще всего, и почти всегда за счёт заказчика.

Что даёт дообучение на практике: модель держит тон и формат без напоминаний в промпте, не съезжает с инструкции к концу длинного диалога, разбирает грязный вход на поля без уговоров и умеет промолчать и передать человеку, когда не уверена. И ещё одна вещь, о которой редко говорят вслух: оно про деньги, а не про ум. Маленькая модель, дообученная на ответах большой, работает быстрее и стоит в разы дешевле — вот это окупается. Разросшийся до трёх экранов промпт, за который вы платите в каждом запросе, сворачивается в поведение модели — это тоже окупается. Всё остальное обычно про контроль и приватность, а не про экономию.

Ступени четвёртая и пятая: то, чего почти никогда не нужно

Продолженное предобучение — это когда модель дочитывает большой корпус текстов вашей отрасли, чтобы освоить её язык целиком. Имеет смысл там, где отраслевой язык действительно чужой для обычной модели: узкая медицина, специфическое право, редкая инженерия. Месяцы, серьёзные данные, серьёзные деньги.

Обучение с нуля — отдельная планета. Чтобы масштаб был осязаем: на один финальный прогон DeepSeek-V3, одной из самых известных открытых моделей, ушло порядка 2,8 миллиона часов работы серверных видеокарт. В деньгах сами разработчики оценили это примерно в 5,6 миллиона долларов и в том же отчёте оговорились, что считали один удачный прогон: без предшествовавших исследований, без сбора данных и без десятков неудачных попыток. Независимые аналитики спорили и с этой суммой: если считать вместе с железом и людьми, счёт идёт на сотни миллионов.

Поэтому, когда вы слышите «мы обучили свою модель», в девяти случаях из десяти это значит: взяли чужие открытые веса, положили сверху свой адаптер, обучили его на своих данных и развернули в своём контуре. Это нормальная, честная и полезная работа. Просто называется она иначе.

Как выбрать ступень за пять минут

Четыре вопроса, которые мы задаём на первом созвоне. Они дешевле любого пилота.

  1. Ответ зависит от того, что изменилось на этой неделе? Если да — вам нужен поиск по данным, и никакое обучение эту задачу не решит.
  2. Можете показать полсотни примеров, где готовая модель ошибается, и рядом написать правильный ответ? Если нет — рано. Не потому что мы вредничаем, а потому что без этого невозможно доказать, что стало лучше.
  3. Сколько стоит одна ошибка? Если неверно названная цена или срок поставки — это претензия и потерянный клиент, начинать надо не с точности, а с умения отказываться и передавать человеку.
  4. Кто внутри компании будет владеть этим через год? Модели обновляются, формы документов меняются, ассортимент растёт. Нет живого человека с фамилией — не начинайте.

Где мы обычно останавливаемся

Теперь неудобная часть. Мы отговариваем от дообучения чаще, чем берёмся за него, и вот признаки, по которым решение принимается почти сразу.

  • Вы хотите зашить в модель сами факты — цены, остатки, сроки. Это не лечится дообучением ни при какой частоте обновления: манеру ответа дообучить можно, факты всё равно придут из поиска.
  • Примеров меньше пары сотен, и взять их негде.
  • Никто не может сформулировать, что считать успехом, в проверяемом виде.
  • Нужна ссылка на источник — «откуда ты это взял». Веса такой ссылки не дают.
  • Поток обращений маленький. Оптимизировать цену запросов, которых десять в день, — это хобби, а не проект.
  • Базовая модель ещё не проверена на нормальном промпте с примерами. Сначала пройдите первую ступень.

И ещё одно наблюдение, из-за которого проекты замирают чаще, чем из-за техники. Заказчик хочет, «чтобы отвечала как наш лучший менеджер». А лучший менеджер — самый занятой человек в компании, и двух дней на разбор примеров у него нет. Ни одна технология эту проблему не решает.

Мы берёмся за дообучение примерно в двух случаях из десяти. В остальных восьми говорим, что задача решается дешевле — и объясняем, чем именно.

Кстати, отраслевая статистика тут не про то, что ИИ не работает. Gartner ещё в 2024 году прогнозировал, что не меньше 30% проектов с генеративным ИИ бросят после пилота, и называл четыре причины: плохие данные, слабый контроль рисков, растущие расходы и неясная польза для бизнеса. Пятую добавлю от себя, по нашим проектам она самая частая: у внедрения нет живого владельца. Ни одна из пяти не про саму модель — и всё это лечится на берегу, если не торопиться сразу к третьей ступени.

Про то, как дообучение выглядит изнутри — куда уходят недели и рубли, что ломается и что остаётся у заказчика на руках, — во второй части.

Не уверены, какая ступень ваша?

Пройдём четыре вопроса из статьи по вашей задаче и скажем прямо: хватит промпта и поиска по данным или действительно нужно дообучение. Разговор бесплатный, и мы не обидимся, если ответ будет «вам это не нужно».