·7 мин. чтения

GLM API в России: как подключить модели Zhipu AI и платить рублями

GLM от Zhipu AI: контекст до 1 048 000 токенов, reasoning и tool calling в разы дешевле западных флагманов. Как подключить GLM API из России: цены и код.

GLM API в России: как подключить модели Zhipu AI и платить рублями

GLM — семейство языковых моделей компании Zhipu AI, которое доступно через платформу Z.ai. За последние версии — GLM 5.1, 5.2 и 5.3 — семейство стало заметным игроком: окно контекста до 1 048 000 токенов, режим рассуждений и агентная работа с инструментами при цене в разы ниже западных флагманов. Для российских команд к этому добавляется практический вопрос: как платить за такой API в рублях и получать закрывающие документы. Разбираем по шагам: модели, цены, код подключения и расчёт стоимости на реальном сценарии.

Почему российские команды смотрят на GLM

У линейки GLM четыре свойства, которые важны для продакшена:

  • Очень большой контекст. У GLM 5.1, 5.2 и 5.3 окно составляет 1 048 000 токенов — в один запрос помещается крупная кодовая база, пакет договоров или длинная история диалога агента.
  • Reasoning. Модели поддерживают режим рассуждений (thinking): модель разбирает задачу по шагам до того, как дать ответ. По каталогу PlusVibe токены рассуждений тарифицируются как выходные — это важно учитывать в бюджете.
  • Агентный tool use. Поддерживается вызов инструментов (function calling): поиск, база данных, внутренние API. Сама Z.ai называет GLM-5.3 флагманом с упором на software engineering и агентные сценарии.
  • Цена. Цены на GLM 5.3 в нашем каталоге — 16,56 ₽ за 1M входных токенов и 52,05 ₽ за 1M выходных. Для сравнения, Claude Opus 4.8 в том же каталоге стоит 110 ₽ входа и 550 ₽ выхода за 1M: разница более чем в 6 раз по входу и более чем в 10 раз по выходу.

Официальная платформа Z.ai предоставляет OpenAI-совместимый HTTP API и работает с популярными SDK. Прямое подключение означает регистрацию на зарубежной площадке и оплату её счетов — для российской компании это валютные платежи, отсутствие рублёвых закрывающих документов и бухгалтерия без привычных актов. Поэтому на практике команды используют российский агрегатор: запросы идут на российский эндпоинт, оплата — в рублях, документы — через ЭДО.

Какие модели GLM доступны в каталоге PlusVibe

Цены ниже взяты из живого каталога plusvibeapi.ru/models на 28 августа 2026 года и указаны за 1 000 000 токенов для варианта по умолчанию:

МодельID для запросовКонтекстМакс. ответВход, ₽Выход, ₽Чтение из кэша, ₽
GLM 5.3z-ai/glm-5.31 048 00032 00016,5652,053
GLM 5.3 Flashz-ai/glm-5.3-flash262 00032 0008,8529,500,89
GLM 5.2z-ai/glm-5.21 048 00032 0004414011
GLM 5.1glm-5.11 048 00032 00010231926

Все четыре модели — текстовые: принимают текст, возвращают текст, поддерживают reasoning и tool calling. Vision нет ни у одной из них.

Варианты GLM 5.3: что означает суффикс в ID

Одна публичная модель у нас может обслуживаться несколькими провайдерскими линиями — это часть механики, которая держит цены ниже флагманских. У GLM 5.3 таких линий несколько. Если отправить запрос с моделью без суффикса — просто z-ai/glm-5.3, — он всегда попадает в вариант по умолчанию; суффикс после двоеточия адресует конкретную линию:

ВариантКак адресоватьВход, ₽/1MВыход, ₽/1MКэш, ₽/1M
По умолчаниюz-ai/glm-5.316,5652,053
Network2z-ai/glm-5.3:network233,12104,103
Cxz-ai/glm-5.3:cx17,6055,31чтение 2, запись 18
Greenz-ai/glm-5.3:green16,5652,0517

Цены актуальны на 28 августа 2026 года.

Линии отличаются не только ценой, но и условиями кэширования. У :cx, например, самое дешёвое чтение из кэша (2 ₽ за 1M), но самая дорогая запись (18 ₽): для сценария с длинным неизменным контекстом, который читается в каждом запросе, это заметно меняет счёт. Цена отдельной линии двигается заметно чаще, чем цена варианта по умолчанию, поэтому таблица — снимок на дату: актуальные цифры всегда смотрите на странице модели в каталоге plusvibeapi.ru/models.

Практический вывод: для большинства сценариев достаточно варианта по умолчанию — именно его вы получаете, отправляя модель без суффикса. Суффикс имеет смысл, только когда вы осознанно хотите закрепить конкретного поставщика или оптимизировать расходы на кэш.

Сколько это стоит: расчёт на реальном сценарии

Типовой сценарий — ассистент поддержки, который отвечает на вопросы сотрудников по внутренней базе знаний. В каждом запросе: 50 000 токенов базы (системный промпт и документы), 2 000 токенов нового вопроса и около 1 500 токенов ответа. Считаем для z-ai/glm-5.3 (вариант по умолчанию):

  • База знаний из кэша: 50 000 × 3 ₽ / 1 000 000 = 0,15 ₽.
  • Новый ввод: 2 000 × 16,56 ₽ / 1 000 000 ≈ 0,03 ₽.
  • Ответ: 1 500 × 52,05 ₽ / 1 000 000 ≈ 0,08 ₽.

Итого примерно 0,26 ₽ за запрос. Если бы контекст не кэшировался, те же 52 000 входных токенов стоили бы около 0,86 ₽, и запрос обошёлся бы примерно в 0,94 ₽ — в 3,6 раза дороже. При 1 000 запросов в день это около 260 ₽ против 940 ₽: кэширование — главный рычаг экономии на длинных системных промптах.

Ключевое соотношение: чтение из кэша у GLM 5.3 стоит 3 ₽ против 16,56 ₽ за обычный вход — более чем в 5 раз дешевле. У GLM 5.3 Flash разрыв ещё больше: 0,89 ₽ чтения из кэша против 8,85 ₽ входа, почти в 10 раз. Если ваше приложение гоняет один и тот же большой контекст в каждом запросе, выбирайте модель и вариант именно по цене кэш-чтения.

Как подключить: ключ, эндпоинт, код

PlusVibe API отдаёт модели GLM через OpenAI-совместимый эндпоинт https://plusvibeapi.ru/v1. Достаточно создать аккаунт, выпустить ключ вида sk-pv-… и передавать его в заголовке Authorization: Bearer <ключ>. В поле model указываются реальные ID из каталога — например, z-ai/glm-5.3.

curl

curl https://plusvibeapi.ru/v1/chat/completions \
  -H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.3",
    "messages": [
      {"role": "system", "content": "Отвечай на вопросы по базе знаний компании."},
      {"role": "user", "content": "Каков порядок продления договора?"}
    ],
    "max_tokens": 1500
  }'

Python (openai SDK)

from openai import OpenAI

client = OpenAI(
    base_url="https://plusvibeapi.ru/v1",
    api_key="sk-pv-ВАШ_КЛЮЧ",
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[
        {"role": "system", "content": "Отвечай на вопросы по базе знаний компании."},
        {"role": "user", "content": "Собери краткую сводку по этому документу."},
    ],
    max_tokens=1500,
)
print(response.choices[0].message.content)

Если в вашем коде уже используется OpenAI SDK, миграция сводится к замене base_url и ключа. Потоковые ответы (stream) и вызов инструментов работают через те же вызовы, что и с OpenAI. Полный список моделей и цен — на странице Модели и цены, технические детали — в документации.

Где GLM подходит, а где — нет

Будем честны: у линейки есть не только сильные стороны.

GLM хорошо подходит для:

  • анализа больших документов и длинных историй диалога — окно в 1 048 000 токенов даёт запас, которого нет у большинства моделей в этом ценовом диапазоне;
  • агентных пайплайнов с вызовом инструментов: поиск, файлы, база данных, внутренние API;
  • работы с кодом и ревью — не зря Z.ai позиционирует GLM-5.3 как флагман для software engineering;
  • массовых текстовых задач с ограниченным бюджетом, особенно с повторяющимся контекстом, где экономит кэш;
  • GLM 5.3 Flash — для дешёвых высоконагруженных сценариев, которым хватает контекста 262 000 токенов.

Где GLM — не лучший выбор:

  • Изображения. Все модели линейки в нашем каталоге — только текст. Никакого vision: ни фотографий, ни скриншотов, ни диаграмм. Для таких задач нужна другая модель.
  • Строгий JSON. JSON mode в каталоге не заявлен. Если ответ должен быть машинно читаемым, проверяйте и парсите его на стороне приложения.
  • Свежие факты. Срез знаний у GLM 5.2 и 5.3 — август 2025 года, у GLM 5.1 — июнь 2025. Актуальные данные передавайте в контексте или получайте через инструменты.
  • Экономия на рассуждениях. Токены режима thinking тарифицируются как выходные: на задачах с длинными размышлениями закладывайте это в бюджет или отключайте режим там, где он не нужен.

Оплата и документы для юрлиц и ИП

PlusVibe — российский сервис, поэтому расчёты и документы устроены привычно для российской бухгалтерии:

  • Оплата в рублях: пополнение баланса картой (Visa, Mastercard, «Мир») или через СБП, счёт на юридическое лицо или ИП.
  • Закрывающие документы формируются по фактически потреблённым услугам за календарный месяц и направляются через ЭДО.
  • Постоплата для юрлиц — договорная отсрочка платежа по ст. 823 ГК РФ: лимит до 5 000 ₽ с оплатой в течение 14 календарных дней, далее до 10 000 ₽ после двух вовремя оплаченных периодов, свыше — индивидуальные условия. Подробности — на странице постоплаты для юрлиц.
  • Работаем без НДС (ИП на УСН) — в счёте и первичном документе указывается «Без НДС».

Итог

GLM — практичный выбор для российских команд, которым нужен большой контекст, reasoning и агентный tool use без флагманских цен: вход у GLM 5.3 стоит 16,56 ₽ за 1M токенов, чтение из кэша — 3 ₽, а самый дешёвый вариант линейки, GLM 5.3 Flash, обходится в 8,85 ₽ входа. Подключение занимает несколько минут: ключ, base_url и реальный ID модели из каталога. Оплата в рублях, закрывающие документы через ЭДО и договорная постоплата для юрлиц закрывают вопросы бухгалтерии. Создайте аккаунт и сделайте первый запрос к z-ai/glm-5.3 уже сегодня.

glm apiglm api россияzhipu apiglm 5.3 apiGLM API из Россииподключить GLM APIGLM API оплата рублямиz-ai glm api для юрлиц

Попробуйте PlusVibe API

OpenAI-совместимый API: GPT, Claude, Gemini, видео и изображения — один рублёвый ключ. Работает из России без VPN, оплата рублями.

Читайте также