Модуль 3.4 · Урок 4
Урок 4: Бенчмарки — какую модель выбрать для OpenClaw
Чему вы научитесь
- Понимать, что измеряет PinchBench — стандартный agentic benchmark для OpenClaw
- Знать топ моделей по success rate на май 2026 (Claude / GPT / Xiaomi / GLM / ByteDance)
- Видеть, где OpenClaw в принципе выигрывает у ChatGPT-ботов и Claude в мессенджерах, а где проигрывает
- Выбирать свою модель под бюджет и тип задач
Зачем нужен бенчмарк
Когда вы выбираете модель для OpenClaw — Claude Opus, Sonnet, Haiku, GPT-5.5, Gemini, Kimi, GLM, локальную через Ollama — у каждой свои сильные и слабые стороны. Заявления вендоров оптимистичны. Реальные бенчмарки показывают, как модели справляются с конкретно agentic-задачами: запустить shell, прочитать почту, заполнить форму, разобрать вложение.
Стандартный бенчмарк для OpenClaw — PinchBench (pinchbench.com). Открытый, методология опубликована, регулярно обновляется.
Что измеряет PinchBench
| Параметр | Значение |
|---|---|
| Количество моделей | 41 (по состоянию на май 2026) |
| Количество задач | 147 |
| Запусков | 448 |
| Категории | Код, аналитика данных, письменность, продуктивность, исследования, безопасность, агентское поведение, творчество |
| Оценка | Автоматизированные проверки + LLM-as-judge |
Задачи реальные, а не синтетические: «организуй inbox по приоритету», «найди и отрезервируй переговорку», «свести таблицу из 3 источников». Это близко к тому, что вы будете делать в OpenClaw.
Топ-10 моделей на май 2026
Источник: pinchbench.com, данные на май 2026.
| Модель | Провайдер | Success rate |
|---|---|---|
| claude-opus-4.7 | Anthropic | 91.6% |
| claude-haiku-4.5 | Anthropic | 90.3% |
| mimo-v2.5-pro | Xiaomi | 89.5% |
| mimo-v2.5 | Xiaomi | 89.5% |
| gpt-5.5 | OpenAI | 89.0% |
| claude-opus-4.6 | Anthropic | 88.9% |
| glm-5v-turbo | Z-AI | 86.6% |
| glm-5-turbo | Z-AI | 86.3% |
| seed-2.0-lite | ByteDance | 86.2% |
| gpt-5.4 | OpenAI | 86.0% |
Что бросается в глаза:
- Anthropic держит топ-2. Opus 4.7 и Haiku 4.5 — не случайность: Anthropic с самого начала позиционировал Claude как «agentic» модель и тренировал на tool-use специально.
- Haiku 4.5 на втором месте с отрывом всего 1.3%. Это удивительно — самая дешёвая модель Anthropic ($1/$5 за 1M токенов) почти догнала топовый Opus 4.7. Для большинства задач Haiku даёт лучший cost/perf.
- Xiaomi MiMo — серьёзный игрок. Третье и четвёртое место. Это китайская модель, доступна через OpenRouter и через свой API. Для пользователей из РФ — вариант без VPN.
- GPT-5.5 на пятом месте. Не лидер, но очень близко. Стоит дороже Haiku при том же или худшем результате на agent-задачах.
Полный live-рейтинг и стоимость per task — на pinchbench.com. Обновляется по мере выхода новых моделей.
Что эти числа означают на практике
91% vs 89% — это не «топовая модель в полтора раза лучше середнячка». Это «из 100 задач топ ошибётся в 9, средняя в 11». Большинство ваших задач отработают одинаково.
Где разница реально проявляется:
- Сложные multi-step задачи (15+ шагов) — топ-модели держат контекст, средние теряют нить
- Tool-use в нестандартной ситуации — топ-модели разбираются с ошибками skills, средние стопорятся
- Russian/китайский текст — Anthropic и китайские (MiMo, GLM) сильнее, чем GPT
- Безопасность (отказ выполнять опасные команды) — заметная разница в сторону Claude
Где OpenClaw выигрывает у ChatGPT-ботов и Claude в мессенджерах
OpenClaw — не единственный способ иметь AI в Telegram. Есть:
- Бесплатные ChatGPT/Claude/Grok-боты в Telegram — общие, без вашей персонализации
- Self-hosted python-боты на Telegraf или Aiogram, где вы сами пишете handlers
- Облачные ассистенты (Microsoft Copilot, Google Gemini в Workspace)
Преимущества OpenClaw:
| Что | Чем лучше |
|---|---|
| Persistent memory | Помнит контекст недели/месяцы. ChatGPT-боты обнуляются при каждой сессии. |
| Реальные действия | Открывает email, calendar, browser. Большинство ботов только читают и отвечают. |
| Один агент во всех мессенджерах | Telegram + WhatsApp + Discord + iMessage — одна персона, одна память. У ChatGPT-ботов — отдельная установка для каждого канала. |
| Кастомизация через soul.md и skills | Без программирования, но глубокая. Custom GPT и Claude Projects ограничены платформой. |
| Open source | Полный аудит кода, no vendor lock-in. Облачные — закрытый код, ваша зависимость от вендора. |
Источники: Reddit /r/OpenAI «openclaw vs ChatGPT plus», getopenclaw.ai/vs/chatgpt.
Где OpenClaw проигрывает
Сложность setup. Поставить ChatGPT Telegram-бот — две минуты через @BotFather. OpenClaw — час, плюс настройка soul.md, plugins, моделей. Для одноразового использования это лишняя работа.
Out-of-the-box reasoning. Если вы хотите просто «спроси модель что-то умное» — лучше идите в нативный ChatGPT/Claude. OpenClaw добавляет слой ассистента, который для простого Q&A только увеличивает latency.
Безопасность. ChatGPT-бот в Telegram читает только то, что ему пишут. OpenClaw читает всё. См. отдельный урок 3.5/04-security — это серьёзно.
Стоимость. Если использовать топ-модели через OpenClaw активно (несколько каналов, постоянная автоматизация) — $10–50 в месяц на API. Бесплатные Telegram-боты от вендоров — $0.
Как выбрать модель для своего OpenClaw
| Сценарий | Рекомендуемая модель |
|---|---|
| Личный ассистент, чат + лёгкая автоматизация | Claude Haiku 4.5 — почти-топ результат за минимальные деньги |
| Серьёзная автоматизация в нескольких каналах | Claude Sonnet 4.6 — баланс качества и цены |
| Сложные задачи, multi-step research | Claude Opus 4.7 — топ, но дороже |
| Из РФ без VPN | Xiaomi MiMo v2.5-pro (через OpenRouter) или GLM-5-turbo |
| Полная приватность, локально | Ollama + Llama 3.1 / Qwen 3.x — провалится в бенчмарках, но никто не увидит данные |
| Multi-agent (см. 3.4/01) | Routing: лёгкие вопросы → Haiku, сложные → Opus 4.7 |
Практика
Задача: прогон вашего OpenClaw на собственном мини-бенчмарке.
- Возьмите 10 типичных запросов, которые вы уже делали агенту за последнюю неделю.
- Прогоните каждый через 3 модели: Haiku 4.5, Sonnet 4.6, ваша текущая.
- Поставьте subjective оценку 1–5 каждому ответу. Сложите.
- Посмотрите соотношение качества к стоимости (
openclaw cost --model <name>).
Часто оказывается, что Haiku 4.5 хватает для 80% ваших задач — и вы тратите в 3 раза меньше.
Что запомнить
- PinchBench — ваш референс для выбора модели. 41 модель, 147 задач, обновляется регулярно.
- Claude Opus 4.7 — топ агентских задач, но Haiku 4.5 обходится в 5 раз дешевле при отрыве в 1.3%.
- Из РФ без VPN — Xiaomi MiMo и Z-AI GLM работают и держат уровень.
- OpenClaw выигрывает у ChatGPT-ботов на persistence и actions, проигрывает на простоте setup.
- На большинстве задач разница между топ-моделями в пределах статистического шума — не переплачивайте.