Что такое большая языковая модель (LLM) простыми словами?
Большая языковая модель — нейросеть, обученная на огромном количестве текстов предсказывать следующее слово. Из этого простого умения вырастают сложные способности: отвечать на вопросы, писать, переводить, пересказывать, рассуждать и писать код. ChatGPT, Claude, Gemini, ГигаЧат и YandexGPT — приложения на основе таких моделей.
Обновлено
Как модель «понимает» текст
Текст разбивается на токены — кусочки слов. Модель превращает их в числа и через миллиарды параметров вычисляет, какой токен вероятнее следующим с учётом всего предыдущего текста. Параметры настраиваются при обучении так, чтобы предсказания совпадали с реальными текстами. Понимание здесь статистическое: модель выучила закономерности языка и знаний, а не хранит энциклопедию.
Что модель умеет и чего не умеет
- Умеет: писать и редактировать тексты, объяснять, переводить, резюмировать, писать код.
- Умеет с инструментами: искать в интернете, считать кодом, работать с файлами.
- Не умеет сама: знать события после даты обучения, гарантированно не ошибаться, помнить вас между чатами без специальной памяти.
Почему «большая»
Большой её называют из-за числа параметров — миллиарды и больше — и объёма обучающих данных. С ростом масштаба у моделей появлялись новые способности: следовать инструкциям, рассуждать по шагам, работать с кодом. Но рост масштаба не убирает основные ограничения вроде выдумывания фактов.
Частые ошибки в восприятии
- Считать модель поисковиком — она генерирует, а не ищет, если поиск не подключён.
- Считать её разумным собеседником с намерениями.
- Считать, что она учится на каждом вашем сообщении в реальном времени.
Пример
Вы пишете «Составь письмо арендодателю о задержке оплаты на неделю». Модель не ищет шаблон в базе — она по шагам генерирует самый вероятный текст делового письма с вашими деталями. Поэтому письмо каждый раз немного разное, но всегда в правильном жанре.
Частые вопросы по теме
Чем LLM отличается от обычной нейросети?
LLM — разновидность нейросети, специализированная на языке и очень большая.
Кто создаёт большие языковые модели?
OpenAI, Anthropic, Google, Meta, Сбер, Яндекс и другие компании и исследовательские группы.
Может ли LLM думать?
Она решает задачи, похожие на рассуждение, но это вычисление вероятностей, а не мышление в человеческом смысле.
Сколько стоит создать LLM?
Обучение крупных моделей стоит десятки и сотни миллионов долларов.
Можно ли запустить LLM у себя?
Небольшие открытые модели — да, через программы вроде Ollama.
Похожие вопросы
Как обучают нейросети вроде ChatGPT?
В три этапа. Сначала предобучение: модель читает огромный массив текстов и учится предсказывать следующее слово. Затем…
02Что такое токены в нейросетях?
Токен — кусочек текста, которым оперирует модель: целое короткое слово, часть длинного слова, знак препинания или…
03Почему нейросеть выдумывает факты?
Языковая модель не ищет ответ в базе фактов, а продолжает текст самым вероятным образом. Если точного знания нет, она…
04Почему ИИ так уверенно ошибается?
Уверенный тон — это стиль текста, а не степень знания. Модель учится писать как хорошие ответы в интернете, а они…
05Почему нейросеть забывает начало разговора?
У модели есть контекстное окно — максимальный объём текста, который она видит за раз. Всё, что в него не помещается…
06Что такое контекстное окно нейросети?
Контекстное окно — это максимальный объём текста в токенах, который модель обрабатывает за один запрос: ваш вопрос…