Чем известен Kimi: длинный контекст, агенты, код
Kimi — семейство моделей китайской компании Moonshot AI. В разработческой среде оно закрепилось благодаря трём вещам: очень длинному контекстному окну, сильной работе с инструментами (tool use) и агентным сценариям, и высокому качеству генерации кода. Сам разработчик позиционирует флагманский Kimi K3 как модель для «долгоживущих» кодинг-агентов, глубоких рассуждений и работы со знаниями — то есть для задач, где модели нужно держать в памяти большой объём материалов и самостоятельно выполнять многошаговые цепочки действий.
Конкретные характеристики Kimi K3 в каталоге PlusVibe (не маркетинг, а рабочие ограничения маршрута):
- Контекстное окно: 262 000 токенов — примерно 200 000 слов: крупная кодовая база, документация и история диалога помещаются в один запрос.
- Максимальный вывод: 32 000 токенов за один ответ.
- Рассуждения: модель думающая — внутренние цепочки рассуждений тарифицируются как выходные токены.
- Tool calling и JSON mode: поддерживаются — основа агентных пайплайнов и структурированного вывода.
- Вход: только текст (изображения и видео через наш шлюз не передаются — об этом ниже).
Можно ли подключиться к Moonshot API из России напрямую
Официальный API Moonshot AI (platform.kimi.ai, эндпоинт api.moonshot.ai) совместим с форматом OpenAI, но прямое подключение из России сопряжено с теми же барьерами, что и у западных платформ:
- Оплата. Для оплаты токенов нужна иностранная банковская карта — российские карты платформа не принимает.
- Доступ. Работа с платформой с российских IP нестабильна, как правило требуется VPN.
- Документы. Закрыть расходы актами и счетами для российской бухгалтерии не получится — это зарубежный сервис.
Для продакшена эти ограничения означают, что прямой доступ — вариант для экспериментов, но не для продукта. Рабочее решение — российский агрегатор, который держит доступ к моделям на своей стороне и проксирует запросы.
Kimi K3 через PlusVibe API: как это устроено
PlusVibe API — российский OpenAI-совместимый шлюз. Вы отправляете запросы на российский эндпоинт https://plusvibeapi.ru/v1 с ключом вида sk-pv-…, а шлюз маршрутизирует их к модели и возвращает ответ. Формат запросов и ответов полностью совпадает с OpenAI Chat Completions API, поэтому любой код на OpenAI SDK переключается заменой base_url и ключа.
Модель вызывается по идентификатору kimi-k3. На 28 августа 2026 года это единственная модель семейства Kimi в нашем публичном каталоге — о версиях, которые доступны у Moonshot, но не доступны у нас, честно рассказываем в конце статьи.
Подключение за 5 минут
curl
curl https://plusvibeapi.ru/v1/chat/completions \
-H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [
{"role": "user", "content": "Составь план миграции сервиса с Flask на FastAPI."}
]
}'
Python (openai SDK)
from openai import OpenAI
client = OpenAI(
base_url="https://plusvibeapi.ru/v1",
api_key="sk-pv-ВАШ_КЛЮЧ",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": "Ты — опытный бэкенд-разработчик."},
{"role": "user", "content": "Напиши функцию на Python для парсинга JSON с обработкой ошибок."},
],
max_tokens=2000,
)
print(response.choices[0].message.content)
Пример с вызовом инструментов — главный сценарий Kimi
Агентные задачи строятся на tool calling: модель сама решает, какую функцию вызвать, вы исполняете её и возвращаете результат обратно. Ниже — полный цикл на Python:
import json
from openai import OpenAI
client = OpenAI(
base_url="https://plusvibeapi.ru/v1",
api_key="sk-pv-ВАШ_КЛЮЧ",
)
tools = [{
"type": "function",
"function": {
"name": "get_order_status",
"description": "Возвращает статус заказа по его номеру",
"parameters": {
"type": "object",
"properties": {
"order_id": {"type": "string", "description": "Номер заказа"}
},
"required": ["order_id"],
},
},
}]
def get_order_status(order_id: str) -> str:
return json.dumps({"order_id": order_id, "status": "отправлен", "eta": "2 дня"})
messages = [{"role": "user", "content": "Где мой заказ A-123?"}]
resp = client.chat.completions.create(model="kimi-k3", messages=messages, tools=tools)
msg = resp.choices[0].message
if msg.tool_calls: # модель решила вызвать инструмент
call = msg.tool_calls[0]
result = get_order_status(**json.loads(call.function.arguments))
messages.append(msg)
messages.append({"role": "tool", "tool_call_id": call.id, "content": result})
resp = client.chat.completions.create(model="kimi-k3", messages=messages, tools=tools)
print(resp.choices[0].message.content)
Цены на Kimi API (на 28 августа 2026 года)
Все цены — в рублях за 1 000 000 токенов, по живому каталогу plusvibeapi.ru/models. Базовый вариант подачи (назначается автоматически при запросе kimi-k3):
- Входящие токены: 26 ₽
- Исходящие токены: 130 ₽
- Чтение из кеша (cache read): 3 ₽
Запись в кеш стоит как обычные входные токены — доплаты за первое кеширование нет.
Одна модель — несколько линий подачи
Один публичный идентификатор модели может обслуживаться сразу несколькими провайдерскими линиями — в каталоге они видны как варианты одной модели. Голый идентификатор без суффикса (kimi-k3 в примерах выше, moonshotai/kimi-k3 в обозначениях каталога) всегда попадает в вариант по умолчанию, а суффикс вида :network или :cx2 в поле model адресует конкретную линию. Линии отличаются ценой и стабильностью, поэтому пин на линию — это осознанный выбор, а не оптимизация по умолчанию: без суффикса сервис сам решает, какой вариант использовать. Цены линий подвижнее цены по умолчанию, так что таблица ниже — снимок на дату публикации.
Цены актуальны на 28 августа 2026 года. Актуальные цифры и состав линий — на странице plusvibeapi.ru/models.
| Вариант | Как адресовать | Вход, ₽/1M | Выход, ₽/1M | Кэш, ₽/1M |
|---|---|---|---|---|
| Cx (по умолчанию) | moonshotai/kimi-k3 | 26 | 130 | 3 |
| Network | moonshotai/kimi-k3:network | 26 | 130 | 3 |
| Network2 | moonshotai/kimi-k3:network2 | 55 | 275 | 6 |
| Cx2 | moonshotai/kimi-k3:cx2 | 16,39 | 105,58 | 2 |
| Cx3 | moonshotai/kimi-k3:cx3 | 16,32 | 104,95 | 2 |
| Cx4 | moonshotai/kimi-k3:cx4 | 16,32 | 104,91 | 2 |
Сколько стоит длинный контекст — и что делает кеширование
Посчитаем реалистичный сценарий: вы скармливаете модели кодовую базу и историю диалога на 250 000 токенов и просите ответ на ~2 000 токенов. По базовому варианту:
- Вход: 250 000 × 26 ₽ / 1M = 6,5 ₽
- Выход: 2 000 × 130 ₽ / 1M = 0,26 ₽
- Итого один запрос с почти полным контекстным окном: меньше 7 ₽.
В агентных циклах главное — кеширование промптов. Каждый шаг агента повторяет почти весь прежний контекст: системный промпт, файлы, историю вызовов. Повторяющаяся часть тарифицируется не по 26 ₽, а по 3 ₽ за 1M — почти в 9 раз дешевле входных токенов. Сравним 10 шагов агента с контекстом 200 000 токенов и ответами по 2 000 токенов:
- Без кеша: 2 000 000 входных токенов × 26 ₽ + 20 000 выходных × 130 ₽ = 52 ₽ + 2,6 ₽ ≈ 55 ₽.
- С кешем (190 000 токенов на шаг читаются из кеша, 10 000 — новые): 1 900 000 × 3 ₽ + 100 000 × 26 ₽ + 20 000 × 130 ₽ = 5,7 ₽ + 2,6 ₽ + 2,6 ₽ ≈ 11 ₽.
Экономия — около пяти раз, и чем длиннее общий префикс запроса, тем она больше. Кеш у Kimi работает по повторяющемуся началу запроса автоматически: держите неизменными системный промпт и статичные материалы в начале messages, и повторные шаги агента будут читаться по сниженной цене.
Что ещё важно знать
- Рассуждения всегда включены. Kimi K3 — думающая модель: перед ответом она генерирует внутреннюю цепочку рассуждений. Отдельной цены за них нет — они тарифицируются как обычные выходные токены, поэтому для коротких быстрых ответов закладывайте запас по выводу.
- JSON mode и структурированный вывод. Через
response_formatможно получить гарантированно валидный JSON — удобно для извлечения данных и интеграции с пайплайнами. - Streaming. Потоковые ответы (
stream: true) работают штатно через OpenAI SDK — важно для длинных ответов и интерактивных агентов. - Многошаговые диалоги. Kimi API не хранит состояние: чтобы модель помнила контекст, передавайте историю
messagesв каждом запросе. Именно здесь и раскрывается окно в 262 000 токенов.
Миграция с существующего OpenAI-кода
Если у вас уже есть интеграция на OpenAI SDK, переключение занимает одну правку:
- client = OpenAI(api_key="sk-...")
+ client = OpenAI(
+ base_url="https://plusvibeapi.ru/v1",
+ api_key="sk-pv-ВАШ_КЛЮЧ",
+ )
Структуры запросов и ответов, tool_calls и параметры остаются прежними.
Оплата, счета и закрывающие документы
Всё, за что вы платите, — токены, фактически потреблённые вашей командой. Оплата полностью российская:
- Пополнение баланса — российские карты (Visa, Mastercard, «Мир») и СБП, в рублях.
- Для юрлиц и ИП — счета на организацию, работа по предоплате.
- Закрывающие документы — формируются по фактически потреблённым услугам за календарный месяц и направляются через ЭДО. Формат первичного документа (акт или иной) согласуется под ваш документооборот.
- НДС — сервис работает как ИП на УСН, в счёте и первичном документе указывается «Без НДС».
- Постоплата — договорная отсрочка платежа по фактическому потреблению (по ст. 823 ГК РФ). Начинают с предоплаты, затем по итогам проверки организации оформляется соглашение: лимит до 5 000 ₽ со сроком оплаты 14 календарных дней, после двух полностью и вовремя оплаченных периодов — до 10 000 ₽, свыше — индивидуальные условия. Подробности — на странице постоплаты для юрлиц.
Честные ограничения
Чтобы не было сюрпризов, вот чего через наш шлюз нет:
- Только одна модель семейства. Moonshot сегодня предлагает также K2.7 Code (специализированная кодинг-модель) и модели K2.6 / K2.5 — в нашем каталоге их нет, доступен только Kimi K3.
- Контекст 262 000 токенов, а не 1 млн. В оригинальном API Moonshot для Kimi K3 заявлен контекст до 1 000 000 токенов; наш маршрут предоставляет окно 262 000 токенов и вывод до 32 000 токенов. Для подавляющего большинства задач — включая целые репозитории — этого достаточно, но сверхдлинные сценарии стоит планировать с учётом этой цифры.
- Только текст. Оригинальный Kimi K3 понимает изображения и видео, наш маршрут передаёт текстовый вход. Если нужен анализ изображений, используйте другие модели каталога с поддержкой vision.
Итог
Kimi K3 — одна из самых сильных моделей для агентных пайплайнов, работы с инструментами и длинного контекста. Через PlusVibe API она доступна из России без VPN и иностранных карт: российский эндпоинт, оплата в рублях, счета и закрывающие документы через ЭДО, постоплата для юрлиц. Подключение — это один base_url и один ключ: зарегистрируйтесь, создайте ключ и сделайте первый запрос к kimi-k3 за 5 минут. Актуальные цены и варианты подачи — в каталоге моделей.