Урок курса

Что такое LLM и как работает большая языковая модель

LangChain 1.0.x: c нуля до продакшн LLM-приложений

LLM, или Large Language Model, — большая языковая модель, обученная продолжать последовательность текста. Она получает контекст, оценивает вероятности возможных следующих токенов и выбирает продолжение. Токен — это не обязательно целое слово: им может быть часть слова, знак пунктуации или короткая последовательность символов.

Как LLM превращает запрос в ответ

Работу модели удобно представить как четыре этапа:

  1. Токенизация. Запрос разбивается на токены и переводится в числовые идентификаторы.
  2. Представление контекста. Transformer сопоставляет токены друг с другом через механизм attention. Благодаря этому модель учитывает, к чему относится местоимение, какой код был показан выше и какое ограничение задал пользователь.
  3. Предсказание следующего токена. На каждом шаге модель строит распределение вероятностей.
  4. Генерация. Выбранный токен добавляется в контекст, после чего процесс повторяется.

LLM не достаёт готовый ответ из базы. Она каждый раз генерирует последовательность заново. Поэтому один и тот же запрос при ненулевой температуре может дать разные формулировки.

Что модель знает и чего не знает

Во время обучения LLM видит большое количество текстов и настраивает миллиарды параметров. В параметрах сохраняются языковые закономерности и статистические связи, а не копия интернета. Отсюда следуют важные ограничения.

  • Дата знаний. Модель может не знать свежих событий и новых версий библиотек.
  • Окно контекста. В один запрос помещается ограниченное число токенов: инструкции, история, документы и будущий ответ делят один бюджет.
  • Галлюцинации. Правдоподобное продолжение не обязано быть фактически верным. Особенно опасны вымышленные ссылки, методы API и точные числа.
  • Нет доступа к внешнему миру по умолчанию. Файлы, БД и API подключаются приложением через tools, RAG или MCP.

Поэтому надёжное LLM-приложение — это не только промпт. Оно добавляет источники данных, проверку структуры ответа, ограничения инструментов и наблюдаемость.

Где применяют LLM

Типичные задачи: классификация обращений, извлечение полей из документов, суммаризация, ответы по базе знаний, генерация кода и управление инструментами. Выбор архитектуры зависит от задачи.

Если ответ должен опираться на внутренние документы, используют RAG. Если модель должна выполнить действие, подключают tool calling или агента. Если формат должен быть строго машинным, применяют structured output и схему валидации.

Стоимость запроса обычно зависит от числа входных и выходных токенов. Поэтому полезно сокращать историю, не передавать лишние документы и выбирать модель по сложности задачи. Маленькая модель часто дешевле и быстрее справляется с классификацией, а более сильная нужна для сложного рассуждения или кода.

Главный вывод: LLM — вероятностный генератор текста. Она становится частью продукта только после того, как приложение добавляет ей актуальные данные, проверку результата и безопасные способы действовать.

Попробуйте решить

Какое утверждение точнее всего описывает генерацию ответа LLM?

Продолжить с проверкой и прогрессом

Откройте интерактивный раннер с заданиями урока.

Перейти к интерактивному уроку