Reasoning-модели и мультимодальность
Две способности современных моделей стоят того, чтобы разобраться в них отдельно: умение «подумать» перед ответом и умение принимать на вход не только текст. Обе заметно расширяют круг задач, обе имеют цену, и обе окружены путаницей в терминах. Здесь разберём, что это такое и когда включать.
Модели с рассуждением: думают перед ответом
Заголовок раздела «Модели с рассуждением: думают перед ответом»Обычная модель начинает писать ответ сразу: первый токен появляется через долю секунды. Модель с рассуждением (reasoning model) сначала генерирует внутренний черновик: разбирает задачу, пробует подходы, ловит собственные ошибки и только потом пишет ответ. У разных провайдеров это называется по-разному: расширенное мышление (extended thinking), режим рассуждения, thinking mode; в основе лежит идея цепочки рассуждений (chain-of-thought): модель рассуждает текстом, шаг за шагом.
Почему это работает? Вспомните из страницы «Что такое LLM»: модель генерирует ответ токен за токеном, и на каждый токен тратится фиксированное количество вычислений. Если ответ должен появиться сразу, у модели буквально нет «времени подумать». Черновик рассуждений — это способ потратить больше вычислений на трудную задачу: модель раскладывает её на шаги, каждый из которых прост, и проверяет себя по ходу. Аналогия — решать уравнение в уме против решения на бумаге: на бумаге можно вернуться на два шага назад и заметить ошибку.
На практике это либо отдельные reasoning-модели, либо режим, который включается у обычной модели. Глубину рассуждения раньше задавали «бюджетом на размышления» в токенах; на современных моделях управление сместилось к уровню усилий (effort: низкий / средний / высокий) или вовсе отдаётся самой модели, которая сама решает, сколько думать (адаптивное мышление). Харнесы обычно дают это включать словом в промпте или настройкой; в Claude Code, например, достаточно попросить модель «think hard» над задачей.
Цена рассуждения
Заголовок раздела «Цена рассуждения»Рассуждение — не бесплатная кнопка «сделать лучше». Токены черновика — это обычные выходные токены: вы платите за них и ждёте, пока они сгенерируются. Ответ, который обычная модель даёт за три секунды, reasoning-модель может обдумывать минуту, а стоимость запроса может вырасти в несколько раз.
Когда включать:
- многошаговые задачи: сложная отладка, где нужно удержать несколько гипотез; проектирование архитектуры; запутанный рефакторинг;
- математика, алгоритмы, задачи с подвохом;
- планирование: разбить большую задачу на шаги перед тем, как агент начнёт её выполнять;
- случаи, когда обычная модель стабильно ошибается: рассуждение часто вытягивает такие задачи.
Когда не включать:
- простые и типовые задачи (переименовать переменную, написать стандартный тест, ответить на фактический вопрос): рассуждение не улучшит результат, только замедлит и удорожит;
- массовые вызовы (классификация, извлечение данных): цена умножается на количество;
- интерактивные сценарии, где важна скорость отклика.
Побочный бонус: у многих моделей черновик рассуждений можно посмотреть. Это полезно для отладки промптов: видно, где модель свернула не туда, и часто понятно, какого контекста ей не хватило.
Мультимодальность: не только текст
Заголовок раздела «Мультимодальность: не только текст»Мультимодальная модель (multimodal model) принимает на вход, кроме текста, другие типы данных: прежде всего изображения, у ряда моделей также PDF и аудио. Внутри всё сводится к тому же механизму: картинка кодируется в представление, которое модель «читает» наравне с текстовыми токенами, и дальше работает обычное предсказание ответа. Важно, что модель именно понимает изображение (может описать его, прочитать текст на нём, разобрать схему), а не просто прикладывает его к запросу.
Для команды это открывает бытовые, но очень полезные сценарии:
- Скриншот бага. Тестировщик вставляет скриншот с ошибкой вместо того, чтобы описывать её словами: «вот экран, кнопка уехала за край, найди причину в этом компоненте». Модель видит и текст ошибки, и раскладку интерфейса.
- Схема архитектуры. Фотография доски после обсуждения или диаграмма из вики: «объясни, как здесь ходят данные» или «сгенерируй заготовки сервисов по этой схеме».
- Макет UI. Скриншот из Figma или даже набросок от руки: «сверстай этот экран на React». Первое приближение получается на удивление близким.
- PDF-документы. Модели, принимающие PDF, читают спецификации, договоры и отчёты вместе с таблицами и вёрсткой, без ручного копирования текста.
- Графики и таблицы. Скриншот дашборда с вопросом «что здесь не так?» — быстрый способ получить первичный анализ.
Пара практических оговорок. Качество разбора зависит от качества картинки: мелкий текст на сжатом скриншоте модель может прочитать с ошибками. И на изображениях модель тоже галлюцинирует: уверенно «прочитать» цифру, которой нет, она вполне способна, так что критичные данные с картинок стоит перепроверять.
Не путать вход с генерацией
Заголовок раздела «Не путать вход с генерацией»Частая путаница: мультимодальность на этой странице — это про вход. Модель принимает изображение и отвечает текстом. Генерация картинок — отдельная способность: у некоторых провайдеров она встроена в те же продукты, у других это отдельные модели (диффузионные генераторы изображений), устроенные иначе.
Практическое следствие: то, что модель отлично разбирает ваши скриншоты, ничего не говорит о том, умеет ли она рисовать, и наоборот. Для работы агентов в IT-команде важен в первую очередь мультимодальный вход: генерация изображений в задачах разработки почти не участвует.
Коротко
Заголовок раздела «Коротко»Рассуждение — это возможность купить качество на сложных задачах за время и деньги; включайте его прицельно, а не по умолчанию. Мультимодальный вход — способ передать модели то, что долго описывать словами: скриншот, схему, макет, PDF. Обе способности — обычные оси выбора модели, наряду с размером и поколением из страницы «Провайдеры и семейства».
Что дальше
Заголовок раздела «Что дальше»- Токены и контекстное окно: во что превращаются ваш текст и картинки внутри модели и где предел объёма.