Как обучают нейросети вроде ChatGPT?
В три этапа. Сначала предобучение: модель читает огромный массив текстов и учится предсказывать следующее слово. Затем дообучение на примерах диалогов, где люди показывают хорошие ответы. Наконец, обучение на оценках: люди или специальные модели сравнивают ответы, и модель учится выдавать те, что оценены выше. Так «предсказатель текста» становится полезным ассистентом.
Обновлено
Этапы подробнее
- Предобучение: тексты из интернета, книг, кода — модель усваивает язык и знания.
- Дообучение на инструкциях: пары «запрос — хороший ответ».
- Обучение с обратной связью: ответы сравниваются, модель поощряется за лучшие.
- Настройка безопасности: модель учат отказывать в опасных запросах.
Откуда берутся особенности поведения
- Угодничество — людям нравились ответы, которые с ними соглашаются.
- Уверенный тон — так звучат хорошие ответы в данных.
- Выдумывание — модель поощряли за ответ, а не за «не знаю».
- Осторожность — результат настройки безопасности.
Учится ли модель на ваших сообщениях
Во время разговора — нет: параметры модели не меняются. Но провайдер может использовать переписку для обучения будущих версий, если вы это разрешили или не отключили в настройках. В бизнес-версиях и API данные для обучения обычно не используются.
Частые заблуждения
- Модель копирует тексты из интернета — она генерирует новые, хотя может воспроизводить частые фрагменты.
- Модель знает всё, что есть в интернете, — только то, что было в обучающих данных до даты отсечки.
- Модель учится прямо сейчас на всех пользователях — нет, обучение идёт отдельными циклами.
Пример
На этапе предобучения модель могла бы продолжить вопрос «Как испечь хлеб?» ещё тремя вопросами — так часто выглядят форумы. После дообучения на диалогах она отвечает рецептом, а после обучения на оценках — рецептом понятным, по шагам и с предупреждением про горячую духовку.
Частые вопросы по теме
Сколько данных нужно для обучения?
Для крупных моделей — триллионы токенов текста.
Как часто обучают новые версии?
Крупные — раз в несколько месяцев или реже; донастройки — чаще.
Кто оценивает ответы при обучении?
Специально нанятые люди и вспомогательные модели.
Можно ли дообучить модель на своих данных?
Да, это называется fine-tuning; для заметок чаще используют поиск по документам (RAG).
Почему модели разных компаний отвечают по-разному?
Разные данные, этапы обучения и правила.
Похожие вопросы
Что такое большая языковая модель (LLM) простыми словами?
Большая языковая модель — нейросеть, обученная на огромном количестве текстов предсказывать следующее слово. Из этого…
02Почему ИИ со всем соглашается?
Модели обучают на оценках людей, а людям больше нравятся ответы, которые с ними соглашаются и хвалят. В итоге ИИ…
03Куда уходят данные, которые я отправляю нейросети?
Текст запроса уходит на серверы провайдера модели, обрабатывается и хранится по его правилам: обычно недели или месяцы…
04Почему нейросеть выдумывает факты?
Языковая модель не ищет ответ в базе фактов, а продолжает текст самым вероятным образом. Если точного знания нет, она…
05Почему ИИ так уверенно ошибается?
Уверенный тон — это стиль текста, а не степень знания. Модель учится писать как хорошие ответы в интернете, а они…
06Почему нейросеть забывает начало разговора?
У модели есть контекстное окно — максимальный объём текста, который она видит за раз. Всё, что в него не помещается…