AIPi

Сравнительный обзор моделей AIPI: Claude, DeepSeek, OpenAI, YandexGPT и GigaChat

Как устроены модели Claude, DeepSeek, OpenAI, YandexGPT и GigaChat, чем они отличаются по характеру и цене, и сравнительная таблица бенчмарков.

Сравнительный обзор моделей AIPI: Claude, DeepSeek, OpenAI, YandexGPT и GigaChat

AIPI работает с несколькими семействами больших языковых моделей одновременно: Claude от Anthropic, DeepSeek, OpenAI, YandexGPT и GigaChat от Сбера. В этом обзоре разберём, что представляет собой каждая линейка, чем модели отличаются друг от друга по характеру и возможностям, и сведём всё в сравнительную таблицу способностей.

Claude (Anthropic)

Семейство Claude — флагманская линейка Anthropic. Все модели этого вендора известны надёжным следованием инструкциям, аккуратной работой с длинным контекстом и сильными «агентными» способностями — то есть умением не просто отвечать, а выполнять многошаговые задачи с инструментами: читать файлы, писать код, запускать команды.

  • Claude Fable 5.1 — топовая модель, «максимум мощи». Самый способный вариант линейки, ориентированный на исследования и сложные длинные задачи.
  • Claude Opus 5 — ступень ниже флагмана, но всё ещё очень сильная модель для сложной агентной работы.
  • Claude Sonnet 5 — рабочий баланс «цена/качество» внутри Anthropic: заметно доступнее флагмана при высокой производительности. Подходит как основная модель для большинства задач.
  • Claude Haiku 4.5 — быстрая и лёгкая модель для простых, высокочастотных задач. Максимальная скорость, но заметно слабее в сложных рассуждениях.

DeepSeek

DeepSeek — открытая китайская линейка, которая выделяется крайне агрессивным соотношением цены и возможностей. Модели DeepSeek славятся тем, что на агентных бенчмарках конкурируют с заметно более дорогими западными флагманами.

  • DeepSeek V4.1 Flash — флагман линейки: по агентным бенчмаркам обходит модели уровней Opus и GPT-5.6 Sol.
  • DeepSeek V4 Pro — прежнее поколение линейки. DeepSeek направляет запросы к V4 Pro на V4.1 Flash, поэтому по возможностям он близок к Flash, но в каталоге сохранён отдельной строкой.
  • DeepSeek V4 Flash Vision — специализированная версия с поддержкой изображений (используется для чтения картинок и документов).

OpenAI

OpenAI — вендор линейки GPT и o-серии. Модели OpenAI отличаются очень большим контекстным окном (до ~1 млн токенов) и сильными результатами в математике, науке и кодинге.

  • GPT-6 Astra — флагман, «эра AGI» по заявлению OpenAI. Топовый результат почти по всем бенчмаркам.
  • GPT-5.6 Sol — вторая по силе модель линейки, по бенчмаркам сопоставима с Opus 5.
  • GPT-5.6 Terra — средний вариант, близкий к Sol по качеству.
  • GPT-5.6 Luna — «бюджетная» модель, которая при этом по кодингу и агентности значительно опережает лёгкие модели конкурентов (например, Haiku).
  • o4-mini и o3 — reasoning-модели o-серии, заточенные под «думать дольше»: сильны в математике и науке, при этом o4-mini по части кодинга даже обходит старший o3.

YandexGPT

YandexGPT — российская линейка от Яндекса. Её главное преимущество — сильная работа с русским языком и локальными фактами, а также работа без VPN.

  • YandexGPT 5.1 Pro — флагман линейки, по общему уровню близок к моделям поколения GPT-4o (2024). Хорош для русскоязычных задач и фактов.
  • YandexGPT Lite — быстрая модель для простых задач и черновиков.

GigaChat (Сбер)

GigaChat — российская линейка от Сбера. Как и YandexGPT, работает без VPN и сильна в русскоязычных задачах и локальных фактах. Актуальное поколение — GigaChat 2 с контекстным окном 128 тыс. токенов; старшие модели мультимодальны и принимают на вход текст, изображения и аудио.

  • GigaChat 2 Max — флагман для самых сложных и масштабных задач. Лучшая в линейке по общим знаниям (MMLU 0,86; ruMMLU 0,80) и следованию инструкциям (IFEval 0,89).
  • GigaChat 2 Pro — средняя модель для ресурсоёмких прикладных задач (анализ документов, экономика, право). По части бенчмарков (MATH, Human Eval, MBPP) вплотную приближается к Max при более низкой цене.
  • GigaChat 2 Lite — быстрая и недорогая модель для рутинных и высокочастотных задач.
  • GigaChat 3 Ultra — новейшая модель линейки, по состоянию на июль 2026 года доступна только физическим лицам в бесплатном режиме.

Сравнительная таблица способностей

Способности оцениваются индексом от 0 до 100 — чем выше, тем лучше. Это агрегированная оценка на основе публичных бенчмарков и документации вендоров.

Модель Агентность Кодинг Следование инструкциям Контекст Рассуждение Русский язык
GPT-6 Astra 97 96 92 97 98 80
Claude Fable 5.1 95 95 96 78 95 82
Claude Opus 5 93 94 95 78 94 82
GPT-5.6 Sol 92 93 90 97 95 80
DeepSeek V4.1 Flash 91 90 88 95 85 72
DeepSeek V4 Pro 90 90 88 95 85 72
Claude Sonnet 5 87 92 94 78 84 80
GPT-5.6 Terra 84 88 88 97 83 78
GPT-5.6 Luna 78 82 84 97 75 74
o4-mini 80 87 85 74 86 78
o3 76 80 86 74 88 78
YandexGPT 5.1 Pro 60 72 90 66 70 97
GigaChat 2 Max 55 74 86 66 74 95
Claude Haiku 4.5 55 55 82 78 55 75
YandexGPT Lite 45 60 78 44 52 88

Что означает каждый индекс:

  • Агентность — способность выполнять многошаговые задачи с инструментами (чтение файлов, запуск команд, работа с терминалом).
  • Кодинг — решение реальных задач программирования и качество генерируемого кода.
  • Следование инструкциям — точность выполнения формата, ролей и требований, заложенных в промпт.
  • Контекст — объём контекстного окна и умение качественно работать с длинными документами и историей.
  • Рассуждение — логика, математика и решение сложных задач, требующих многошаговых выводов.
  • Русский язык — качество работы с русскоязычными текстами, локальными фактами и культурными реалиями.

Оценка GigaChat 2 Max агрегирована по официальным бенчмаркам Сбера (MMLU, ruMMLU, MATH, GSM8K, Human Eval, MBPP, IFEval, Arena-Hard RU). Прямых публичных результатов по агентным бенчмаркам уровня SWE-bench и Terminal-Bench у GigaChat нет, поэтому «Агентность» и «Кодинг» оценены консервативно.

Как выбрать модель

  • Максимум качества — GPT-6 Astra или Claude Fable 5.1. Они близки по возможностям; Astra чуть сильнее в науке и длинных агентных задачах.
  • Оптимум «цена/качество» — DeepSeek V4.1 Flash: результат уровня флагманов при заметно более низкой цене.
  • Сильный универсал среднего сегмента — Claude Sonnet 5 или GPT-5.6 Sol.
  • Лёгкий, но с головой для кодинга — GPT-5.6 Luna: она заметно умнее лёгких моделей конкурентов.
  • Русскоязычные задачи и локальные факты — YandexGPT 5.1 Pro или GigaChat 2 Max: обе работают без VPN и сильны в русском языке, YandexGPT чуть лучше следует инструкциям, GigaChat сильнее в кодинге и математике.

Источники

#модели#claude#deepseek#openai#yandexgpt#gigachat#бенчмарки#обзор