Сравнительный обзор моделей AIPI: Claude, DeepSeek, OpenAI, YandexGPT и GigaChat
Как устроены модели Claude, DeepSeek, OpenAI, YandexGPT и GigaChat, чем они отличаются по характеру и цене, и сравнительная таблица бенчмарков.
AIPI работает с несколькими семействами больших языковых моделей одновременно: Claude от Anthropic, DeepSeek, OpenAI, YandexGPT и GigaChat от Сбера. В этом обзоре разберём, что представляет собой каждая линейка, чем модели отличаются друг от друга по характеру и возможностям, и сведём всё в сравнительную таблицу способностей.
Claude (Anthropic)
Семейство Claude — флагманская линейка Anthropic. Все модели этого вендора известны надёжным следованием инструкциям, аккуратной работой с длинным контекстом и сильными «агентными» способностями — то есть умением не просто отвечать, а выполнять многошаговые задачи с инструментами: читать файлы, писать код, запускать команды.
- Claude Fable 5.1 — топовая модель, «максимум мощи». Самый способный вариант линейки, ориентированный на исследования и сложные длинные задачи.
- Claude Opus 5 — ступень ниже флагмана, но всё ещё очень сильная модель для сложной агентной работы.
- Claude Sonnet 5 — рабочий баланс «цена/качество» внутри Anthropic: заметно доступнее флагмана при высокой производительности. Подходит как основная модель для большинства задач.
- Claude Haiku 4.5 — быстрая и лёгкая модель для простых, высокочастотных задач. Максимальная скорость, но заметно слабее в сложных рассуждениях.
DeepSeek
DeepSeek — открытая китайская линейка, которая выделяется крайне агрессивным соотношением цены и возможностей. Модели DeepSeek славятся тем, что на агентных бенчмарках конкурируют с заметно более дорогими западными флагманами.
- DeepSeek V4.1 Flash — флагман линейки: по агентным бенчмаркам обходит модели уровней Opus и GPT-5.6 Sol.
- DeepSeek V4 Pro — прежнее поколение линейки. DeepSeek направляет запросы к V4 Pro на V4.1 Flash, поэтому по возможностям он близок к Flash, но в каталоге сохранён отдельной строкой.
- DeepSeek V4 Flash Vision — специализированная версия с поддержкой изображений (используется для чтения картинок и документов).
OpenAI
OpenAI — вендор линейки GPT и o-серии. Модели OpenAI отличаются очень большим контекстным окном (до ~1 млн токенов) и сильными результатами в математике, науке и кодинге.
- GPT-6 Astra — флагман, «эра AGI» по заявлению OpenAI. Топовый результат почти по всем бенчмаркам.
- GPT-5.6 Sol — вторая по силе модель линейки, по бенчмаркам сопоставима с Opus 5.
- GPT-5.6 Terra — средний вариант, близкий к Sol по качеству.
- GPT-5.6 Luna — «бюджетная» модель, которая при этом по кодингу и агентности значительно опережает лёгкие модели конкурентов (например, Haiku).
- o4-mini и o3 — reasoning-модели o-серии, заточенные под «думать дольше»: сильны в математике и науке, при этом o4-mini по части кодинга даже обходит старший o3.
YandexGPT
YandexGPT — российская линейка от Яндекса. Её главное преимущество — сильная работа с русским языком и локальными фактами, а также работа без VPN.
- YandexGPT 5.1 Pro — флагман линейки, по общему уровню близок к моделям поколения GPT-4o (2024). Хорош для русскоязычных задач и фактов.
- YandexGPT Lite — быстрая модель для простых задач и черновиков.
GigaChat (Сбер)
GigaChat — российская линейка от Сбера. Как и YandexGPT, работает без VPN и сильна в русскоязычных задачах и локальных фактах. Актуальное поколение — GigaChat 2 с контекстным окном 128 тыс. токенов; старшие модели мультимодальны и принимают на вход текст, изображения и аудио.
- GigaChat 2 Max — флагман для самых сложных и масштабных задач. Лучшая в линейке по общим знаниям (MMLU 0,86; ruMMLU 0,80) и следованию инструкциям (IFEval 0,89).
- GigaChat 2 Pro — средняя модель для ресурсоёмких прикладных задач (анализ документов, экономика, право). По части бенчмарков (MATH, Human Eval, MBPP) вплотную приближается к Max при более низкой цене.
- GigaChat 2 Lite — быстрая и недорогая модель для рутинных и высокочастотных задач.
- GigaChat 3 Ultra — новейшая модель линейки, по состоянию на июль 2026 года доступна только физическим лицам в бесплатном режиме.
Сравнительная таблица способностей
Способности оцениваются индексом от 0 до 100 — чем выше, тем лучше. Это агрегированная оценка на основе публичных бенчмарков и документации вендоров.
| Модель | Агентность | Кодинг | Следование инструкциям | Контекст | Рассуждение | Русский язык |
|---|---|---|---|---|---|---|
| GPT-6 Astra | 97 | 96 | 92 | 97 | 98 | 80 |
| Claude Fable 5.1 | 95 | 95 | 96 | 78 | 95 | 82 |
| Claude Opus 5 | 93 | 94 | 95 | 78 | 94 | 82 |
| GPT-5.6 Sol | 92 | 93 | 90 | 97 | 95 | 80 |
| DeepSeek V4.1 Flash | 91 | 90 | 88 | 95 | 85 | 72 |
| DeepSeek V4 Pro | 90 | 90 | 88 | 95 | 85 | 72 |
| Claude Sonnet 5 | 87 | 92 | 94 | 78 | 84 | 80 |
| GPT-5.6 Terra | 84 | 88 | 88 | 97 | 83 | 78 |
| GPT-5.6 Luna | 78 | 82 | 84 | 97 | 75 | 74 |
| o4-mini | 80 | 87 | 85 | 74 | 86 | 78 |
| o3 | 76 | 80 | 86 | 74 | 88 | 78 |
| YandexGPT 5.1 Pro | 60 | 72 | 90 | 66 | 70 | 97 |
| GigaChat 2 Max | 55 | 74 | 86 | 66 | 74 | 95 |
| Claude Haiku 4.5 | 55 | 55 | 82 | 78 | 55 | 75 |
| YandexGPT Lite | 45 | 60 | 78 | 44 | 52 | 88 |
Что означает каждый индекс:
- Агентность — способность выполнять многошаговые задачи с инструментами (чтение файлов, запуск команд, работа с терминалом).
- Кодинг — решение реальных задач программирования и качество генерируемого кода.
- Следование инструкциям — точность выполнения формата, ролей и требований, заложенных в промпт.
- Контекст — объём контекстного окна и умение качественно работать с длинными документами и историей.
- Рассуждение — логика, математика и решение сложных задач, требующих многошаговых выводов.
- Русский язык — качество работы с русскоязычными текстами, локальными фактами и культурными реалиями.
Оценка GigaChat 2 Max агрегирована по официальным бенчмаркам Сбера (MMLU, ruMMLU, MATH, GSM8K, Human Eval, MBPP, IFEval, Arena-Hard RU). Прямых публичных результатов по агентным бенчмаркам уровня SWE-bench и Terminal-Bench у GigaChat нет, поэтому «Агентность» и «Кодинг» оценены консервативно.
Как выбрать модель
- Максимум качества — GPT-6 Astra или Claude Fable 5.1. Они близки по возможностям; Astra чуть сильнее в науке и длинных агентных задачах.
- Оптимум «цена/качество» — DeepSeek V4.1 Flash: результат уровня флагманов при заметно более низкой цене.
- Сильный универсал среднего сегмента — Claude Sonnet 5 или GPT-5.6 Sol.
- Лёгкий, но с головой для кодинга — GPT-5.6 Luna: она заметно умнее лёгких моделей конкурентов.
- Русскоязычные задачи и локальные факты — YandexGPT 5.1 Pro или GigaChat 2 Max: обе работают без VPN и сильны в русском языке, YandexGPT чуть лучше следует инструкциям, GigaChat сильнее в кодинге и математике.
Источники
- GPT-6 Astra: Benchmarks, Pricing and API Access — ComputingForgeeks
- Introducing Claude Fable 5.1 and Claude Mythos 5.1 — Anthropic
- DeepSeek V4.1 Flash Benchmarks — Flowtivity
- Claude Haiku 4.5 vs GPT-5.6 Luna — BenchLM
- GPT-5.6 Sol benchmarks & pricing — The Model Gap
- Claude Sonnet 5: Benchmarks, Pricing & Verdict — Cosmic JS
- OpenAI o4-mini vs o3 — Linos
- YandexGPT 5.1 Pro — цена и бенчмарки — mregs.ru
- Модели GigaChat — документация Сбера