Granite 4.2 8B — рассуждающая модель IBM на 8 млрд параметров с плотной декодерной архитектурой. Её назначение по описанию IBM: математика, генерация кода, многоязычный диалог и агентные сценарии, где нужно несколько шагов рассуждения.
Глубина мышления переключается: полное рассуждение по умолчанию, режим без него и облегчённый режим с короткой цепочкой. Рассуждения выводятся в тегах think, а при вызове функций модель обдумывает, какой инструмент нужен и зачем. Ответ можно ограничить JSON-схемой.
Контекст составляет 131 072 токена, максимальный ответ 117 964 токена. IBM заявляет 12 языков, среди которых английский, немецкий, французский, японский, китайский, арабский. Русского в перечне нет. Модель получена дообучением Granite 4.1 8B Base, затем применено обучение с подкреплением методом GRPO.
Веса открыты под лицензией Apache 2.0. IBM советует при развёртывании проверять ответы моделью Granite Guardian.
Кому подходит
Командам, которым нужна небольшая модель с рассуждениями и открытой лицензией
Задачам по математике, коду и многошаговой логике
Агентам, где глубину мышления нужно менять по шагам
Ограничения
Только текст на входе и выходе: изображения и аудио не принимаются
Русского нет в заявленных 12 языках: качество на нём придётся проверять самим
Рассуждения идут в тегах think: в режиме полного рассуждения их нужно отделять от итогового ответа
Сценарии использования
Проверка математических выкладок — Преподаватель или аналитик включает полное рассуждение и разбирает задачу по шагам, сверяя промежуточные результаты.
Генерация и исправление кода — Разработчик просит набросать функцию или найти ошибку в небольшом модуле и получает объяснение хода рассуждений.
Лёгкий агент со своими инструментами — Инженер подключает вызов функций к внутреннему справочнику и просит модель решить, какой запрос выполнить.
Быстрые ответы без цепочки мыслей — Разработчик чат-бота отключает рассуждение для простых вопросов и получает ответ сразу.
FAQ
Какие режимы мышления есть у Granite 4.2 8B?
Три: полное рассуждение по умолчанию, режим без рассуждений и облегчённый режим. Выбор делается в запросе.
Умеет ли модель вызывать функции?
Да, и при этом рассуждает, какой инструмент вызвать. Поддерживается и структурированный вывод по JSON-схеме.
Какие рекомендуемые настройки генерации?
IBM советует температуру 1.0 и top_p 0.95.
Достаточно ли ей контекста для моей задачи?
Это зависит от размера входа: контекст составляет 131 072 токена, ответ может быть до 117 964 токенов.
Свободна ли лицензия?
Да, веса открыты под лицензией Apache 2.0 и лежат на Hugging Face.