Как обучают нейросети вроде ChatGPT?

В три этапа. Сначала предобучение: модель читает огромный массив текстов и учится предсказывать следующее слово. Затем дообучение на примерах диалогов, где люди показывают хорошие ответы. Наконец, обучение на оценках: люди или специальные модели сравнивают ответы, и модель учится выдавать те, что оценены выше. Так «предсказатель текста» становится полезным ассистентом.

Обновлено

Подробно

Этапы подробнее

  1. Предобучение: тексты из интернета, книг, кода — модель усваивает язык и знания.
  2. Дообучение на инструкциях: пары «запрос — хороший ответ».
  3. Обучение с обратной связью: ответы сравниваются, модель поощряется за лучшие.
  4. Настройка безопасности: модель учат отказывать в опасных запросах.
Следствия

Откуда берутся особенности поведения

Данные

Учится ли модель на ваших сообщениях

Во время разговора — нет: параметры модели не меняются. Но провайдер может использовать переписку для обучения будущих версий, если вы это разрешили или не отключили в настройках. В бизнес-версиях и API данные для обучения обычно не используются.

Мифы

Частые заблуждения

Пример

Пример

На этапе предобучения модель могла бы продолжить вопрос «Как испечь хлеб?» ещё тремя вопросами — так часто выглядят форумы. После дообучения на диалогах она отвечает рецептом, а после обучения на оценках — рецептом понятным, по шагам и с предупреждением про горячую духовку.

Вопросы

Частые вопросы по теме

Сколько данных нужно для обучения?

Для крупных моделей — триллионы токенов текста.

Как часто обучают новые версии?

Крупные — раз в несколько месяцев или реже; донастройки — чаще.

Кто оценивает ответы при обучении?

Специально нанятые люди и вспомогательные модели.

Можно ли дообучить модель на своих данных?

Да, это называется fine-tuning; для заметок чаще используют поиск по документам (RAG).

Почему модели разных компаний отвечают по-разному?

Разные данные, этапы обучения и правила.