GLM-5.3 — новая версия модели Zhipu AI с контекстом 1M токенов
GLM-5.3 от Zhipu AI доступна в каталоге PlusVibe через OpenAI-совместимый API. Это текстовая reasoning-модель: она умеет разбирать задачу по шагам в режиме thinking, вызывать инструменты и работать с очень большим контекстом. Модель подходит для кода, анализа документов и агентных сценариев, где одного короткого запроса недостаточно.
Что изменилось относительно GLM-5.2
GLM-5.3 — следующая версия семейства GLM-5.x. При этом по опубликованным в каталоге возможностям она не выглядит как модель с другим форм-фактором: у GLM-5.2 и GLM-5.3 одинаковые заявленные окно контекста 1 048 000 токенов, максимальный ответ 32 000 токенов, поддержка reasoning и tool calling, а также текстовый ввод без vision.
Это важное практическое отличие от рекламного сравнения по одному номеру версии. Переход на GLM-5.3 не требует рассчитывать на новый формат запросов или другой лимит контекста. Одновременно каталог не содержит сопоставимых бенчмарков, поэтому мы не будем обещать, что 5.3 лучше 5.2 на каждой задаче. Если результат критичен, сравните обе версии на собственных примерах: коде, документах и инструментах, которые использует ваше приложение.
Характеристики GLM-5.3
| Параметр | Значение |
|---|---|
| Контекст | 1 048 000 токенов |
| Максимальный вывод | 32 000 токенов |
| Рассуждения | Да, режим thinking |
| Tool calling / function calling | Поддерживается |
| JSON mode | Не заявлен |
| Ввод и вывод | Текст |
| Vision | Нет |
| Срез знаний в каталоге | Август 2025 |
Окно в 1 048 000 токенов полезно, когда в один запрос нужно передать большую кодовую базу, несколько документов или длинную историю работы агента. Лимит контекста не означает, что любой такой запрос будет одинаково быстрым или дешёвым: оплачиваются фактически обработанные входные и выходные токены.
Цена и пример расчёта
Цена варианта по умолчанию z-ai/glm-5.3 составляет 16,56 ₽ за 1M входных токенов и 52,05 ₽ за 1M выходных токенов. Для повторяющегося контекста каталог указывает cache read и cache write по 3 ₽ за 1M токенов.
Например, запрос с 1M новых входных токенов и 200 000 выходных токенов будет стоить: 1 × 16,56 ₽ + 0,2 × 52,05 ₽ = 26,97 ₽. Это ориентир для конкретного объёма токенов, а не фиксированная стоимость запроса: короткий ответ обойдётся дешевле, длинный — дороже.
В каталоге также доступны варианты с суффиксами провайдера. z-ai/glm-5.3:cx стоит 14,61 / 45,91 ₽ за 1M входа и выхода, а z-ai/glm-5.3:network2 — 33,12 / 104,10 ₽. По умолчанию используется вариант Network без суффикса: его цена приведена выше.
Как вызвать модель
Используйте обычный endpoint Chat Completions. В поле model передаётся публичный ID z-ai/glm-5.3:
curl https://plusvibeapi.ru/v1/chat/completions \
-H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3",
"messages": [{"role": "user", "content": "Объясни этот фрагмент кода и предложи тесты."}],
"max_tokens": 2000
}'
Тот же вызов через Python SDK:
from openai import OpenAI
client = OpenAI(
api_key="sk-pv-ВАШ_КЛЮЧ",
base_url="https://plusvibeapi.ru/v1",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[{"role": "user", "content": "Составь план миграции базы данных."}],
max_tokens=2000,
)
print(response.choices[0].message.content)
Для каких задач подходит
- Разработка и ревью кода. Режим thinking помогает разложить задачу на этапы, проверить предположения и объяснить найденные проблемы.
- Агентные пайплайны. Tool calling позволяет передавать модели функции поиска, работы с файлами, базой данных или внутренними API.
- Большие документы. Миллион токенов контекста даёт запас для технической документации, истории переписки и нескольких связанных файлов.
- Аналитика и структурирование. Модель может извлекать факты, сравнивать части текста и готовить последовательный ответ.
Ограничения
GLM-5.3 принимает только текст: изображения передать нельзя, поэтому задачи с фотографиями, скриншотами и диаграммами требуют предварительного OCR или другой модели с vision. JSON mode в каталоге не заявлен, значит для строгого машинного формата нужно проверять ответ на стороне приложения и обрабатывать ошибки парсинга.
Reasoning и tool calling не гарантируют правильное решение. Модель может ошибиться в выводах, неверно интерпретировать большой документ или вызвать инструмент с неподходящими аргументами. Ограничивайте доступные функции, проверяйте их параметры и не передавайте результат без валидации дальше по цепочке. Дата среза знаний — август 2025, поэтому свежие факты лучше передавать в контексте или получать через инструмент.
Как начать тестирование
Для первого прогона возьмите небольшой набор реальных запросов: один фрагмент кода, один длинный документ и один сценарий с инструментом. Сохраните промпты и ответы, отдельно посчитайте входные и выходные токены, а затем сравните результат с GLM-5.2 на тех же данных. Такой тест покажет не только качество, но и влияние reasoning, размера контекста и кеширования на итоговый расход. Для публичного сервиса добавьте тайм-аут, повтор только для безопасных операций и журналирование ошибок без сохранения секретного содержимого.
GLM-5.3 уже доступна в PlusVibe. Начните с варианта по умолчанию z-ai/glm-5.3, измерьте качество и расход на своих запросах, а затем при необходимости выберите вариант с суффиксом провайдера.
