DeepSeek V4.1 Flash и GLM-5.3 от Zhipu AI (Z.ai) — две открытые модели, которые сейчас чаще всего сравнивают для программирования и агентных сценариев. Обе дают контекст около 1M токенов, обе рассуждают перед ответом и вызывают инструменты. Но устроены и позиционированы они по-разному, а разница в цене — больше чем на порядок.
Ниже — только проверяемые цифры со ссылками на источники, отзывы разработчиков и практический вывод: когда какую модель брать.
Коротко
- DeepSeek V4.1 Flash — сильнее на задачах в реальных репозиториях (DeepSWE, NL2Repo, Terminal-Bench 2.1), в несколько раз быстрее и в 11–15 раз дешевле GLM-5.3 в нашем каталоге. Разговорчива: тратит много токенов на рассуждения.
- GLM-5.3 — выше в общем индексе Artificial Analysis (45 против 39) и на самых новых, длинных терминальных задачах Terminal-Bench 4.0. Медленнее и заметно дороже.
- Для большинства задач кодинга разумно начинать с DeepSeek V4.1 Flash, а GLM-5.3 держать для длинных многошаговых задач, где Flash не справляется.
Бенчмарки: что говорят цифры
Основной источник прямого сравнения — таблица в карточке модели DeepSeek V4.1 Flash. Важно: это замеры самой DeepSeek, в режиме максимальных рассуждений. Результат GLM-5.3 на DeepSWE (66,9) совпадает с тем, что публикует сама Z.ai в документации GLM-5.3.
БенчмаркDeepSeek V4.1 FlashGLM-5.3Что измеряет DeepSWE v1.174,266,9исправление задач в реальных репозиториях NL2Repo-Bench64,058,0сборка репозитория по текстовому описанию Terminal-Bench 2.190,688,2задачи в терминале Terminal-Bench 3.030,028,3более сложные терминальные задачи Terminal-Bench 4.031,237,9самые длинные и сложные терминальные задачи GPQA Diamond90,988,1научные вопросы уровня аспирантурыЧто из этого следует:
- Работа с репозиторием — сторона DeepSeek. На DeepSWE разрыв 7 пунктов, на NL2Repo — 6. По DeepSWE DeepSeek V4.1 Flash в этой же таблице стоит вровень с закрытыми флагманами (Opus 5.0 — 74,0, GPT-5.6 Sol — 73,0).
- Terminal-Bench 4.0 — сторона GLM-5.3. 37,9 против 31,2. Это самая новая и самая тяжёлая версия теста, и на ней GLM-5.3 впереди. Но до лидеров ей далеко: в той же таблице у Opus 5.0 — 51,8, у GPT-5.6 Sol — 39,9.
- Отдельного теста на отладку в источниках нет. Ближе всего к ней DeepSWE — там модель чинит реальные задачи в чужом коде, и там впереди DeepSeek.
Artificial Analysis: 45 против 39
Независимый рейтинг Artificial Analysis ставит GLM-5.3 выше: 45 баллов против 39 у DeepSeek V4.1 Flash (Intelligence Index v4.3.2). Индекс собран из 10 тестов, и кодинг там — только часть: кроме Terminal-Bench 4.0 в него входят офисные и исследовательские задачи (GDPval-AA, AA-Briefcase, Humanity's Last Exam, SciCode и другие). Поэтому 45 против 39 говорит о более широкой «общей эрудиции» GLM-5.3, а не о том, что она лучше пишет код.
Цифры разных версий индекса нельзя сравнивать между собой: в августе, по версии v4.1.1, GLM-5.3 получила 60 баллов. Сравнивайте модели только в одной версии.
Длинные агентные задачи
Z.ai прямо позиционирует GLM-5.3 для сложной разработки и «длинных» агентных задач. По данным компании, GLM-5.3 — это дообучение GLM-5.2 без новой базовой модели, и именно оно подняло Terminal-Bench 3.0 с 4,6 до 28,3, а DeepSWE — с 46,2 до 66,9. При этом в обзоре Verdent отмечено, что рост не переносится на любые длинные задачи: на бизнес-симуляции Vending-Bench 2 результаты GLM-5.3 и GLM-5.2 пересекаются. Иначе говоря, преимущество GLM-5.3 касается длинных задач в коде и терминале, а не «агентов вообще».
Скорость
По замерам Artificial Analysis на 25 сентября 2026 года, на API разработчиков моделей:
- DeepSeek V4.1 Flash — около 233 токенов в секунду, первый токен через 0,97 с.
- GLM-5.3 — около 63 токенов в секунду, первый токен через 3,37 с.
Разница по скорости генерации — примерно в 3,7 раза. Для агента, который делает десятки шагов, это разница между минутами и десятками минут. Скорость зависит от площадки, на которой запущена модель, поэтому точные цифры у разных сервисов отличаются, но порядок сохраняется.
Отчасти скорость DeepSeek объясняется архитектурой. По карточке модели, у V4.1 Flash 552B параметров, но на один токен активно лишь 8B при чтении входа и 16B при генерации. У GLM-5.3, по данным Artificial Analysis, 753B параметров и 40B активных.
Цена через PlusVibe
Текущие цены из живого каталога:
| Модель | Вход | Выход |
|---|---|---|
| deepseek-v4.1-flash | 1,14 ₽/1M | 4,53 ₽/1M |
| glm-5.3 | 16,56 ₽/1M | 52,05 ₽/1M |
На момент написания, 25 сентября 2026 года, варианты по умолчанию стоили так (₽ за 1M токенов):
DeepSeek V4.1 FlashGLM-5.3 Вход1,14 ₽16,56 ₽ Выход4,53 ₽52,05 ₽ Чтение из кэша0,11 ₽3 ₽Пример: задача агента с 1M входных токенов и 200 000 выходных обойдётся в 1,14 + 0,2 × 4,53 ≈ 2,05 ₽ на DeepSeek V4.1 Flash и в 16,56 + 0,2 × 52,05 ≈ 26,97 ₽ на GLM-5.3 — примерно в 13 раз дороже. Для агентов особенно важен кэш: повторно отправляемый контекст на DeepSeek стоит 0,11 ₽ за 1M, на GLM-5.3 — 3 ₽.
Одна поправка: DeepSeek V4.1 Flash многословнее. При прогоне индекса Artificial Analysis она сгенерировала 250M выходных токенов против 210M у GLM-5.3, а обе модели там отмечены как «very verbose». Это немного сокращает разрыв в цене за задачу, но не меняет вывода.
Что пишут разработчики
Мы собрали отзывы с Hacker News за сентябрь 2026 года. Цитаты даны в нашем переводе, со ссылкой на оригинал.
«Я пользуюсь DeepSeek-V4.1-Flash, а до этого V4-Pro и -Flash, потому что они очень дешёвые. Когда я даю модели GPT-5.x сложную задачу, она часто сдаётся или жульничает, меняя тесты, а модели DeepSeek упорнее и реже жульничают. GLM-5.3, GLM-5.3-Flash и Kimi K3 тоже нормальные, но медленнее, дороже и хуже подходят для моих задач — в основном Python и CUDA».
«Мне очень нравится Deepseek v4.1 Flash: она очень „прямолинейная“, иногда почти до глупости, но абсолютно неутомимая и решит почти любую задачу, пусть и неэффективно».
«Я предпочитаю GLM 5.3 (Flash или обычную) вместо Deepseek 4.1 Flash, потому что модели GLM заметно менее многословны».
«Я попробовал заменить Luna Max на Deepseek v4.1 flash и сжигал токенов примерно на 7 долларов за день. Это больше, чем стоит моя подписка OpenAI».
«Если бы GLM 5.3 не съела четверть моего месячного бюджета за 5 часов, выходило бы примерно 30 долларов».
«V4.1 Flash явно оптимизирована под агентный вызов инструментов ценой и окна контекста, и знаний. Они хотели модель, которую дёшево хостить и которая быстро отвечает».
«Стоит учесть, что GLM 5.3 не мультимодальная, у неё нет слоя зрения».
Картина из отзывов сходится с бенчмарками: DeepSeek V4.1 Flash хвалят за упорство и цену, но ругают за многословность. GLM-5.3 выбирают за более сдержанные ответы и считают дорогой. Помните, что счёт в долларах из этих отзывов — это цены других площадок, а не PlusVibe.
Когда что выбирать
Берите DeepSeek V4.1 Flash, если:
- задача — правки в существующем репозитории: баги, фичи, рефакторинг на несколько файлов;
- агент делает много шагов, и важна скорость ответа;
- большой повторяющийся контекст: кэш стоит копейки;
- результат можно проверить автоматически — тестами, линтером, сборкой. Тогда многословность и «прямолинейность» модели не мешают;
- нужны скриншоты или изображения на входе: по карточке модели DeepSeek V4.1 Flash принимает текст и изображения.
Берите GLM-5.3, если:
- задача длинная и терминальная — много команд подряд, настройка окружения, многошаговая отладка, где Flash застревает;
- нужна более широкая «эрудиция» за пределами кода — на это указывает индекс Artificial Analysis;
- важны менее многословные ответы, а цена и скорость вторичны.
Практичная схема для агентов: по умолчанию запускать DeepSeek V4.1 Flash, а при повторных неудачах на одной задаче переключать этот шаг на GLM-5.3. Так основная масса работы идёт по низкой цене, а дорогая модель включается точечно. Для длинных сессий на любой модели полезно держать требования в отдельном файле (план, спецификация) и периодически передавать его заново, а не рассчитывать, что модель удержит всё из начала диалога.
Сравнительная таблица
DeepSeek V4.1 FlashGLM-5.3 РазработчикDeepSeekZhipu AI (Z.ai) Выход моделисентябрь 2026август 2026 Параметры (всего / активных)552B / 8–16B753B / 40B Контекст1M токенов1M токенов Максимальный ответ в PlusVibe393 216 токенов128 000 токенов Ввод по данным разработчикатекст и изображениятолько текст ЛицензияMITсобственная лицензия Z.ai DeepSWE / NL2Repo74,2 / 64,066,9 / 58,0 Terminal-Bench 4.031,237,9 Artificial Analysis Index3945 Скорость (Artificial Analysis)~233 ток/с~63 ток/с Цена в PlusVibe1,14 ₽/1M вход · 4,53 ₽/1M выход16,56 ₽/1M вход · 52,05 ₽/1M выходКак вызвать обе модели через API
Обе модели доступны через один OpenAI-совместимый endpoint и один ключ. Идентификаторы в поле model: deepseek-v4.1-flash и z-ai/glm-5.3.
curl https://plusvibeapi.ru/v1/chat/completions \
-H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4.1-flash",
"messages": [{"role": "user", "content": "Найди причину падения теста и предложи исправление."}],
"max_tokens": 4000
}'
Тот же код на Python с переключением на GLM-5.3 при неудаче:
from openai import OpenAI
client = OpenAI(
api_key="sk-pv-ВАШ_КЛЮЧ",
base_url="https://plusvibeapi.ru/v1",
)
def ask(model: str, prompt: str) -> str:
response = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
max_tokens=4000,
)
return response.choices[0].message.content
answer = ask("deepseek-v4.1-flash", "Напиши миграцию и тесты к ней.")
# если проверка не прошла — повторить шаг на более дорогой модели
# answer = ask("z-ai/glm-5.3", "Напиши миграцию и тесты к ней.")
Обе модели подключаются к агентам для кода по той же схеме — например, к Claude Code, OpenCode, Cline или Kilo Code. Подробнее о каждой модели — в обзорах GLM-5.3 и DeepSeek API в России, а характеристики и цены всех вариантов — на страницах DeepSeek V4.1 Flash и GLM-5.3.
Итог
Для повседневного кодинга и агентов DeepSeek V4.1 Flash — лучший выбор по соотношению цены и результата: она впереди на тестах с реальными репозиториями, быстрее в несколько раз и дешевле больше чем на порядок. GLM-5.3 выигрывает там, где задача очень длинная и терминальная, и в широком общем индексе, но за это приходится платить временем и деньгами. Проверьте обе модели на десятке своих задач — через один ключ PlusVibe это занимает несколько минут.



