·8 мин. чтения

Kimi API в России: как подключить Kimi K3 от Moonshot AI

Kimi K3 от Moonshot AI из России: контекст 262 000 токенов, агентные задачи и код. Цены в рублях на 28.08.2026, примеры кода, оплата и документы для юрлиц.

Чем известен Kimi: длинный контекст, агенты, код

Kimi — семейство моделей китайской компании Moonshot AI. В разработческой среде оно закрепилось благодаря трём вещам: очень длинному контекстному окну, сильной работе с инструментами (tool use) и агентным сценариям, и высокому качеству генерации кода. Сам разработчик позиционирует флагманский Kimi K3 как модель для «долгоживущих» кодинг-агентов, глубоких рассуждений и работы со знаниями — то есть для задач, где модели нужно держать в памяти большой объём материалов и самостоятельно выполнять многошаговые цепочки действий.

Конкретные характеристики Kimi K3 в каталоге PlusVibe (не маркетинг, а рабочие ограничения маршрута):

  • Контекстное окно: 262 000 токенов — примерно 200 000 слов: крупная кодовая база, документация и история диалога помещаются в один запрос.
  • Максимальный вывод: 32 000 токенов за один ответ.
  • Рассуждения: модель думающая — внутренние цепочки рассуждений тарифицируются как выходные токены.
  • Tool calling и JSON mode: поддерживаются — основа агентных пайплайнов и структурированного вывода.
  • Вход: только текст (изображения и видео через наш шлюз не передаются — об этом ниже).

Можно ли подключиться к Moonshot API из России напрямую

Официальный API Moonshot AI (platform.kimi.ai, эндпоинт api.moonshot.ai) совместим с форматом OpenAI, но прямое подключение из России сопряжено с теми же барьерами, что и у западных платформ:

  • Оплата. Для оплаты токенов нужна иностранная банковская карта — российские карты платформа не принимает.
  • Доступ. Работа с платформой с российских IP нестабильна, как правило требуется VPN.
  • Документы. Закрыть расходы актами и счетами для российской бухгалтерии не получится — это зарубежный сервис.

Для продакшена эти ограничения означают, что прямой доступ — вариант для экспериментов, но не для продукта. Рабочее решение — российский агрегатор, который держит доступ к моделям на своей стороне и проксирует запросы.

Kimi K3 через PlusVibe API: как это устроено

PlusVibe API — российский OpenAI-совместимый шлюз. Вы отправляете запросы на российский эндпоинт https://plusvibeapi.ru/v1 с ключом вида sk-pv-…, а шлюз маршрутизирует их к модели и возвращает ответ. Формат запросов и ответов полностью совпадает с OpenAI Chat Completions API, поэтому любой код на OpenAI SDK переключается заменой base_url и ключа.

Модель вызывается по идентификатору kimi-k3. На 28 августа 2026 года это единственная модель семейства Kimi в нашем публичном каталоге — о версиях, которые доступны у Moonshot, но не доступны у нас, честно рассказываем в конце статьи.

Подключение за 5 минут

curl

curl https://plusvibeapi.ru/v1/chat/completions \
  -H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {"role": "user", "content": "Составь план миграции сервиса с Flask на FastAPI."}
    ]
  }'

Python (openai SDK)

from openai import OpenAI

client = OpenAI(
    base_url="https://plusvibeapi.ru/v1",
    api_key="sk-pv-ВАШ_КЛЮЧ",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "Ты — опытный бэкенд-разработчик."},
        {"role": "user", "content": "Напиши функцию на Python для парсинга JSON с обработкой ошибок."},
    ],
    max_tokens=2000,
)
print(response.choices[0].message.content)

Пример с вызовом инструментов — главный сценарий Kimi

Агентные задачи строятся на tool calling: модель сама решает, какую функцию вызвать, вы исполняете её и возвращаете результат обратно. Ниже — полный цикл на Python:

import json
from openai import OpenAI

client = OpenAI(
    base_url="https://plusvibeapi.ru/v1",
    api_key="sk-pv-ВАШ_КЛЮЧ",
)

tools = [{
    "type": "function",
    "function": {
        "name": "get_order_status",
        "description": "Возвращает статус заказа по его номеру",
        "parameters": {
            "type": "object",
            "properties": {
                "order_id": {"type": "string", "description": "Номер заказа"}
            },
            "required": ["order_id"],
        },
    },
}]

def get_order_status(order_id: str) -> str:
    return json.dumps({"order_id": order_id, "status": "отправлен", "eta": "2 дня"})

messages = [{"role": "user", "content": "Где мой заказ A-123?"}]

resp = client.chat.completions.create(model="kimi-k3", messages=messages, tools=tools)
msg = resp.choices[0].message

if msg.tool_calls:  # модель решила вызвать инструмент
    call = msg.tool_calls[0]
    result = get_order_status(**json.loads(call.function.arguments))
    messages.append(msg)
    messages.append({"role": "tool", "tool_call_id": call.id, "content": result})
    resp = client.chat.completions.create(model="kimi-k3", messages=messages, tools=tools)

print(resp.choices[0].message.content)

Цены на Kimi API (на 28 августа 2026 года)

Все цены — в рублях за 1 000 000 токенов, по живому каталогу plusvibeapi.ru/models. Базовый вариант подачи (назначается автоматически при запросе kimi-k3):

  • Входящие токены: 26 ₽
  • Исходящие токены: 130 ₽
  • Чтение из кеша (cache read): 3 ₽

Запись в кеш стоит как обычные входные токены — доплаты за первое кеширование нет.

Одна модель — несколько линий подачи

Один публичный идентификатор модели может обслуживаться сразу несколькими провайдерскими линиями — в каталоге они видны как варианты одной модели. Голый идентификатор без суффикса (kimi-k3 в примерах выше, moonshotai/kimi-k3 в обозначениях каталога) всегда попадает в вариант по умолчанию, а суффикс вида :network или :cx2 в поле model адресует конкретную линию. Линии отличаются ценой и стабильностью, поэтому пин на линию — это осознанный выбор, а не оптимизация по умолчанию: без суффикса сервис сам решает, какой вариант использовать. Цены линий подвижнее цены по умолчанию, так что таблица ниже — снимок на дату публикации.

Цены актуальны на 28 августа 2026 года. Актуальные цифры и состав линий — на странице plusvibeapi.ru/models.

Вариант Как адресовать Вход, ₽/1M Выход, ₽/1M Кэш, ₽/1M
Cx (по умолчанию)moonshotai/kimi-k3261303
Networkmoonshotai/kimi-k3:network261303
Network2moonshotai/kimi-k3:network2552756
Cx2moonshotai/kimi-k3:cx216,39105,582
Cx3moonshotai/kimi-k3:cx316,32104,952
Cx4moonshotai/kimi-k3:cx416,32104,912

Сколько стоит длинный контекст — и что делает кеширование

Посчитаем реалистичный сценарий: вы скармливаете модели кодовую базу и историю диалога на 250 000 токенов и просите ответ на ~2 000 токенов. По базовому варианту:

  • Вход: 250 000 × 26 ₽ / 1M = 6,5 ₽
  • Выход: 2 000 × 130 ₽ / 1M = 0,26 ₽
  • Итого один запрос с почти полным контекстным окном: меньше 7 ₽.

В агентных циклах главное — кеширование промптов. Каждый шаг агента повторяет почти весь прежний контекст: системный промпт, файлы, историю вызовов. Повторяющаяся часть тарифицируется не по 26 ₽, а по 3 ₽ за 1M — почти в 9 раз дешевле входных токенов. Сравним 10 шагов агента с контекстом 200 000 токенов и ответами по 2 000 токенов:

  • Без кеша: 2 000 000 входных токенов × 26 ₽ + 20 000 выходных × 130 ₽ = 52 ₽ + 2,6 ₽ ≈ 55 ₽.
  • С кешем (190 000 токенов на шаг читаются из кеша, 10 000 — новые): 1 900 000 × 3 ₽ + 100 000 × 26 ₽ + 20 000 × 130 ₽ = 5,7 ₽ + 2,6 ₽ + 2,6 ₽ ≈ 11 ₽.

Экономия — около пяти раз, и чем длиннее общий префикс запроса, тем она больше. Кеш у Kimi работает по повторяющемуся началу запроса автоматически: держите неизменными системный промпт и статичные материалы в начале messages, и повторные шаги агента будут читаться по сниженной цене.

Что ещё важно знать

  • Рассуждения всегда включены. Kimi K3 — думающая модель: перед ответом она генерирует внутреннюю цепочку рассуждений. Отдельной цены за них нет — они тарифицируются как обычные выходные токены, поэтому для коротких быстрых ответов закладывайте запас по выводу.
  • JSON mode и структурированный вывод. Через response_format можно получить гарантированно валидный JSON — удобно для извлечения данных и интеграции с пайплайнами.
  • Streaming. Потоковые ответы (stream: true) работают штатно через OpenAI SDK — важно для длинных ответов и интерактивных агентов.
  • Многошаговые диалоги. Kimi API не хранит состояние: чтобы модель помнила контекст, передавайте историю messages в каждом запросе. Именно здесь и раскрывается окно в 262 000 токенов.

Миграция с существующего OpenAI-кода

Если у вас уже есть интеграция на OpenAI SDK, переключение занимает одну правку:

- client = OpenAI(api_key="sk-...")
+ client = OpenAI(
+     base_url="https://plusvibeapi.ru/v1",
+     api_key="sk-pv-ВАШ_КЛЮЧ",
+ )

Структуры запросов и ответов, tool_calls и параметры остаются прежними.

Оплата, счета и закрывающие документы

Всё, за что вы платите, — токены, фактически потреблённые вашей командой. Оплата полностью российская:

  • Пополнение баланса — российские карты (Visa, Mastercard, «Мир») и СБП, в рублях.
  • Для юрлиц и ИП — счета на организацию, работа по предоплате.
  • Закрывающие документы — формируются по фактически потреблённым услугам за календарный месяц и направляются через ЭДО. Формат первичного документа (акт или иной) согласуется под ваш документооборот.
  • НДС — сервис работает как ИП на УСН, в счёте и первичном документе указывается «Без НДС».
  • Постоплата — договорная отсрочка платежа по фактическому потреблению (по ст. 823 ГК РФ). Начинают с предоплаты, затем по итогам проверки организации оформляется соглашение: лимит до 5 000 ₽ со сроком оплаты 14 календарных дней, после двух полностью и вовремя оплаченных периодов — до 10 000 ₽, свыше — индивидуальные условия. Подробности — на странице постоплаты для юрлиц.

Честные ограничения

Чтобы не было сюрпризов, вот чего через наш шлюз нет:

  • Только одна модель семейства. Moonshot сегодня предлагает также K2.7 Code (специализированная кодинг-модель) и модели K2.6 / K2.5 — в нашем каталоге их нет, доступен только Kimi K3.
  • Контекст 262 000 токенов, а не 1 млн. В оригинальном API Moonshot для Kimi K3 заявлен контекст до 1 000 000 токенов; наш маршрут предоставляет окно 262 000 токенов и вывод до 32 000 токенов. Для подавляющего большинства задач — включая целые репозитории — этого достаточно, но сверхдлинные сценарии стоит планировать с учётом этой цифры.
  • Только текст. Оригинальный Kimi K3 понимает изображения и видео, наш маршрут передаёт текстовый вход. Если нужен анализ изображений, используйте другие модели каталога с поддержкой vision.

Итог

Kimi K3 — одна из самых сильных моделей для агентных пайплайнов, работы с инструментами и длинного контекста. Через PlusVibe API она доступна из России без VPN и иностранных карт: российский эндпоинт, оплата в рублях, счета и закрывающие документы через ЭДО, постоплата для юрлиц. Подключение — это один base_url и один ключ: зарегистрируйтесь, создайте ключ и сделайте первый запрос к kimi-k3 за 5 минут. Актуальные цены и варианты подачи — в каталоге моделей.

kimi apikimi api россияmoonshot apikimi k3 apikimi api из россииkimi api подключениеkimi api оплата рублямиmoonshot ai api россияkimi k3 цена за токены

Попробуйте PlusVibe API

OpenAI-совместимый API: GPT, Claude, Gemini, видео и изображения — один рублёвый ключ. Работает из России без VPN, оплата рублями.

Читайте также