Перейти к содержимому

Reasoning-модели и мультимодальность

Две способности современных моделей стоят того, чтобы разобраться в них отдельно: умение «подумать» перед ответом и умение принимать на вход не только текст. Обе заметно расширяют круг задач, обе имеют цену, и обе окружены путаницей в терминах. Здесь разберём, что это такое и когда включать.

Модели с рассуждением: думают перед ответом

Заголовок раздела «Модели с рассуждением: думают перед ответом»

Обычная модель начинает писать ответ сразу: первый токен появляется через долю секунды. Модель с рассуждением (reasoning model) сначала генерирует внутренний черновик: разбирает задачу, пробует подходы, ловит собственные ошибки и только потом пишет ответ. У разных провайдеров это называется по-разному: расширенное мышление (extended thinking), режим рассуждения, thinking mode; в основе лежит идея цепочки рассуждений (chain-of-thought): модель рассуждает текстом, шаг за шагом.

Почему это работает? Вспомните из страницы «Что такое LLM»: модель генерирует ответ токен за токеном, и на каждый токен тратится фиксированное количество вычислений. Если ответ должен появиться сразу, у модели буквально нет «времени подумать». Черновик рассуждений — это способ потратить больше вычислений на трудную задачу: модель раскладывает её на шаги, каждый из которых прост, и проверяет себя по ходу. Аналогия — решать уравнение в уме против решения на бумаге: на бумаге можно вернуться на два шага назад и заметить ошибку.

На практике это либо отдельные reasoning-модели, либо режим, который включается у обычной модели. Глубину рассуждения раньше задавали «бюджетом на размышления» в токенах; на современных моделях управление сместилось к уровню усилий (effort: низкий / средний / высокий) или вовсе отдаётся самой модели, которая сама решает, сколько думать (адаптивное мышление). Харнесы обычно дают это включать словом в промпте или настройкой; в Claude Code, например, достаточно попросить модель «think hard» над задачей.

Рассуждение — не бесплатная кнопка «сделать лучше». Токены черновика — это обычные выходные токены: вы платите за них и ждёте, пока они сгенерируются. Ответ, который обычная модель даёт за три секунды, reasoning-модель может обдумывать минуту, а стоимость запроса может вырасти в несколько раз.

Когда включать:

  • многошаговые задачи: сложная отладка, где нужно удержать несколько гипотез; проектирование архитектуры; запутанный рефакторинг;
  • математика, алгоритмы, задачи с подвохом;
  • планирование: разбить большую задачу на шаги перед тем, как агент начнёт её выполнять;
  • случаи, когда обычная модель стабильно ошибается: рассуждение часто вытягивает такие задачи.

Когда не включать:

  • простые и типовые задачи (переименовать переменную, написать стандартный тест, ответить на фактический вопрос): рассуждение не улучшит результат, только замедлит и удорожит;
  • массовые вызовы (классификация, извлечение данных): цена умножается на количество;
  • интерактивные сценарии, где важна скорость отклика.

Побочный бонус: у многих моделей черновик рассуждений можно посмотреть. Это полезно для отладки промптов: видно, где модель свернула не туда, и часто понятно, какого контекста ей не хватило.

Мультимодальная модель (multimodal model) принимает на вход, кроме текста, другие типы данных: прежде всего изображения, у ряда моделей также PDF и аудио. Внутри всё сводится к тому же механизму: картинка кодируется в представление, которое модель «читает» наравне с текстовыми токенами, и дальше работает обычное предсказание ответа. Важно, что модель именно понимает изображение (может описать его, прочитать текст на нём, разобрать схему), а не просто прикладывает его к запросу.

Для команды это открывает бытовые, но очень полезные сценарии:

  • Скриншот бага. Тестировщик вставляет скриншот с ошибкой вместо того, чтобы описывать её словами: «вот экран, кнопка уехала за край, найди причину в этом компоненте». Модель видит и текст ошибки, и раскладку интерфейса.
  • Схема архитектуры. Фотография доски после обсуждения или диаграмма из вики: «объясни, как здесь ходят данные» или «сгенерируй заготовки сервисов по этой схеме».
  • Макет UI. Скриншот из Figma или даже набросок от руки: «сверстай этот экран на React». Первое приближение получается на удивление близким.
  • PDF-документы. Модели, принимающие PDF, читают спецификации, договоры и отчёты вместе с таблицами и вёрсткой, без ручного копирования текста.
  • Графики и таблицы. Скриншот дашборда с вопросом «что здесь не так?» — быстрый способ получить первичный анализ.

Пара практических оговорок. Качество разбора зависит от качества картинки: мелкий текст на сжатом скриншоте модель может прочитать с ошибками. И на изображениях модель тоже галлюцинирует: уверенно «прочитать» цифру, которой нет, она вполне способна, так что критичные данные с картинок стоит перепроверять.

Частая путаница: мультимодальность на этой странице — это про вход. Модель принимает изображение и отвечает текстом. Генерация картинок — отдельная способность: у некоторых провайдеров она встроена в те же продукты, у других это отдельные модели (диффузионные генераторы изображений), устроенные иначе.

Практическое следствие: то, что модель отлично разбирает ваши скриншоты, ничего не говорит о том, умеет ли она рисовать, и наоборот. Для работы агентов в IT-команде важен в первую очередь мультимодальный вход: генерация изображений в задачах разработки почти не участвует.

Рассуждение — это возможность купить качество на сложных задачах за время и деньги; включайте его прицельно, а не по умолчанию. Мультимодальный вход — способ передать модели то, что долго описывать словами: скриншот, схему, макет, PDF. Обе способности — обычные оси выбора модели, наряду с размером и поколением из страницы «Провайдеры и семейства».

Автор учебника — Шахматов Алексей