GLM API в России: как подключить модели Zhipu AI и платить рублями
GLM — семейство языковых моделей компании Zhipu AI, которое доступно через платформу Z.ai. За последние версии — GLM 5.1, 5.2 и 5.3 — семейство стало заметным игроком: окно контекста до 1 048 000 токенов, режим рассуждений и агентная работа с инструментами при цене в разы ниже западных флагманов. Для российских команд к этому добавляется практический вопрос: как платить за такой API в рублях и получать закрывающие документы. Разбираем по шагам: модели, цены, код подключения и расчёт стоимости на реальном сценарии.
Почему российские команды смотрят на GLM
У линейки GLM четыре свойства, которые важны для продакшена:
- Очень большой контекст. У GLM 5.1, 5.2 и 5.3 окно составляет 1 048 000 токенов — в один запрос помещается крупная кодовая база, пакет договоров или длинная история диалога агента.
- Reasoning. Модели поддерживают режим рассуждений (thinking): модель разбирает задачу по шагам до того, как дать ответ. По каталогу PlusVibe токены рассуждений тарифицируются как выходные — это важно учитывать в бюджете.
- Агентный tool use. Поддерживается вызов инструментов (function calling): поиск, база данных, внутренние API. Сама Z.ai называет GLM-5.3 флагманом с упором на software engineering и агентные сценарии.
- Цена. Цены на GLM 5.3 в нашем каталоге — 16,56 ₽ за 1M входных токенов и 52,05 ₽ за 1M выходных. Для сравнения, Claude Opus 4.8 в том же каталоге стоит 110 ₽ входа и 550 ₽ выхода за 1M: разница более чем в 6 раз по входу и более чем в 10 раз по выходу.
Официальная платформа Z.ai предоставляет OpenAI-совместимый HTTP API и работает с популярными SDK. Прямое подключение означает регистрацию на зарубежной площадке и оплату её счетов — для российской компании это валютные платежи, отсутствие рублёвых закрывающих документов и бухгалтерия без привычных актов. Поэтому на практике команды используют российский агрегатор: запросы идут на российский эндпоинт, оплата — в рублях, документы — через ЭДО.
Какие модели GLM доступны в каталоге PlusVibe
Цены ниже взяты из живого каталога plusvibeapi.ru/models на 28 августа 2026 года и указаны за 1 000 000 токенов для варианта по умолчанию:
| Модель | ID для запросов | Контекст | Макс. ответ | Вход, ₽ | Выход, ₽ | Чтение из кэша, ₽ |
|---|---|---|---|---|---|---|
| GLM 5.3 | z-ai/glm-5.3 | 1 048 000 | 32 000 | 16,56 | 52,05 | 3 |
| GLM 5.3 Flash | z-ai/glm-5.3-flash | 262 000 | 32 000 | 8,85 | 29,50 | 0,89 |
| GLM 5.2 | z-ai/glm-5.2 | 1 048 000 | 32 000 | 44 | 140 | 11 |
| GLM 5.1 | glm-5.1 | 1 048 000 | 32 000 | 102 | 319 | 26 |
Все четыре модели — текстовые: принимают текст, возвращают текст, поддерживают reasoning и tool calling. Vision нет ни у одной из них.
Варианты GLM 5.3: что означает суффикс в ID
Одна публичная модель у нас может обслуживаться несколькими провайдерскими линиями — это часть механики, которая держит цены ниже флагманских. У GLM 5.3 таких линий несколько. Если отправить запрос с моделью без суффикса — просто z-ai/glm-5.3, — он всегда попадает в вариант по умолчанию; суффикс после двоеточия адресует конкретную линию:
| Вариант | Как адресовать | Вход, ₽/1M | Выход, ₽/1M | Кэш, ₽/1M |
|---|---|---|---|---|
| По умолчанию | z-ai/glm-5.3 | 16,56 | 52,05 | 3 |
| Network2 | z-ai/glm-5.3:network2 | 33,12 | 104,10 | 3 |
| Cx | z-ai/glm-5.3:cx | 17,60 | 55,31 | чтение 2, запись 18 |
| Green | z-ai/glm-5.3:green | 16,56 | 52,05 | 17 |
Цены актуальны на 28 августа 2026 года.
Линии отличаются не только ценой, но и условиями кэширования. У :cx, например, самое дешёвое чтение из кэша (2 ₽ за 1M), но самая дорогая запись (18 ₽): для сценария с длинным неизменным контекстом, который читается в каждом запросе, это заметно меняет счёт. Цена отдельной линии двигается заметно чаще, чем цена варианта по умолчанию, поэтому таблица — снимок на дату: актуальные цифры всегда смотрите на странице модели в каталоге plusvibeapi.ru/models.
Практический вывод: для большинства сценариев достаточно варианта по умолчанию — именно его вы получаете, отправляя модель без суффикса. Суффикс имеет смысл, только когда вы осознанно хотите закрепить конкретного поставщика или оптимизировать расходы на кэш.
Сколько это стоит: расчёт на реальном сценарии
Типовой сценарий — ассистент поддержки, который отвечает на вопросы сотрудников по внутренней базе знаний. В каждом запросе: 50 000 токенов базы (системный промпт и документы), 2 000 токенов нового вопроса и около 1 500 токенов ответа. Считаем для z-ai/glm-5.3 (вариант по умолчанию):
- База знаний из кэша: 50 000 × 3 ₽ / 1 000 000 = 0,15 ₽.
- Новый ввод: 2 000 × 16,56 ₽ / 1 000 000 ≈ 0,03 ₽.
- Ответ: 1 500 × 52,05 ₽ / 1 000 000 ≈ 0,08 ₽.
Итого примерно 0,26 ₽ за запрос. Если бы контекст не кэшировался, те же 52 000 входных токенов стоили бы около 0,86 ₽, и запрос обошёлся бы примерно в 0,94 ₽ — в 3,6 раза дороже. При 1 000 запросов в день это около 260 ₽ против 940 ₽: кэширование — главный рычаг экономии на длинных системных промптах.
Ключевое соотношение: чтение из кэша у GLM 5.3 стоит 3 ₽ против 16,56 ₽ за обычный вход — более чем в 5 раз дешевле. У GLM 5.3 Flash разрыв ещё больше: 0,89 ₽ чтения из кэша против 8,85 ₽ входа, почти в 10 раз. Если ваше приложение гоняет один и тот же большой контекст в каждом запросе, выбирайте модель и вариант именно по цене кэш-чтения.
Как подключить: ключ, эндпоинт, код
PlusVibe API отдаёт модели GLM через OpenAI-совместимый эндпоинт https://plusvibeapi.ru/v1. Достаточно создать аккаунт, выпустить ключ вида sk-pv-… и передавать его в заголовке Authorization: Bearer <ключ>. В поле model указываются реальные ID из каталога — например, z-ai/glm-5.3.
curl
curl https://plusvibeapi.ru/v1/chat/completions \
-H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.3",
"messages": [
{"role": "system", "content": "Отвечай на вопросы по базе знаний компании."},
{"role": "user", "content": "Каков порядок продления договора?"}
],
"max_tokens": 1500
}'
Python (openai SDK)
from openai import OpenAI
client = OpenAI(
base_url="https://plusvibeapi.ru/v1",
api_key="sk-pv-ВАШ_КЛЮЧ",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[
{"role": "system", "content": "Отвечай на вопросы по базе знаний компании."},
{"role": "user", "content": "Собери краткую сводку по этому документу."},
],
max_tokens=1500,
)
print(response.choices[0].message.content)
Если в вашем коде уже используется OpenAI SDK, миграция сводится к замене base_url и ключа. Потоковые ответы (stream) и вызов инструментов работают через те же вызовы, что и с OpenAI. Полный список моделей и цен — на странице Модели и цены, технические детали — в документации.
Где GLM подходит, а где — нет
Будем честны: у линейки есть не только сильные стороны.
GLM хорошо подходит для:
- анализа больших документов и длинных историй диалога — окно в 1 048 000 токенов даёт запас, которого нет у большинства моделей в этом ценовом диапазоне;
- агентных пайплайнов с вызовом инструментов: поиск, файлы, база данных, внутренние API;
- работы с кодом и ревью — не зря Z.ai позиционирует GLM-5.3 как флагман для software engineering;
- массовых текстовых задач с ограниченным бюджетом, особенно с повторяющимся контекстом, где экономит кэш;
- GLM 5.3 Flash — для дешёвых высоконагруженных сценариев, которым хватает контекста 262 000 токенов.
Где GLM — не лучший выбор:
- Изображения. Все модели линейки в нашем каталоге — только текст. Никакого vision: ни фотографий, ни скриншотов, ни диаграмм. Для таких задач нужна другая модель.
- Строгий JSON. JSON mode в каталоге не заявлен. Если ответ должен быть машинно читаемым, проверяйте и парсите его на стороне приложения.
- Свежие факты. Срез знаний у GLM 5.2 и 5.3 — август 2025 года, у GLM 5.1 — июнь 2025. Актуальные данные передавайте в контексте или получайте через инструменты.
- Экономия на рассуждениях. Токены режима thinking тарифицируются как выходные: на задачах с длинными размышлениями закладывайте это в бюджет или отключайте режим там, где он не нужен.
Оплата и документы для юрлиц и ИП
PlusVibe — российский сервис, поэтому расчёты и документы устроены привычно для российской бухгалтерии:
- Оплата в рублях: пополнение баланса картой (Visa, Mastercard, «Мир») или через СБП, счёт на юридическое лицо или ИП.
- Закрывающие документы формируются по фактически потреблённым услугам за календарный месяц и направляются через ЭДО.
- Постоплата для юрлиц — договорная отсрочка платежа по ст. 823 ГК РФ: лимит до 5 000 ₽ с оплатой в течение 14 календарных дней, далее до 10 000 ₽ после двух вовремя оплаченных периодов, свыше — индивидуальные условия. Подробности — на странице постоплаты для юрлиц.
- Работаем без НДС (ИП на УСН) — в счёте и первичном документе указывается «Без НДС».
Итог
GLM — практичный выбор для российских команд, которым нужен большой контекст, reasoning и агентный tool use без флагманских цен: вход у GLM 5.3 стоит 16,56 ₽ за 1M токенов, чтение из кэша — 3 ₽, а самый дешёвый вариант линейки, GLM 5.3 Flash, обходится в 8,85 ₽ входа. Подключение занимает несколько минут: ключ, base_url и реальный ID модели из каталога. Оплата в рублях, закрывающие документы через ЭДО и договорная постоплата для юрлиц закрывают вопросы бухгалтерии. Создайте аккаунт и сделайте первый запрос к z-ai/glm-5.3 уже сегодня.
