
За последний год я перепробовал десяток моделей на реальной генерации контента от Reels-сценариев до лонгридов. Вывод простой и немного неудобный: универсальной лучшей модели нет. У каждой свой характер, и выбор зависит от типа контента и аудитории.
В этом посте как я подбираю модель под задачу, какой пайплайн гоняю в продукте и чем это подкреплено: данными LMArena, FLASK, Arena Expert и собственным экспериментом по измерению креативности.
Коротко
- Нет лучшей модели есть характеры. Gemini объясняет, Claude рассказывает, DeepSeek штампует дёшево, GPT строг и формален.
- Рабочий пайплайн: дёшево генерим черновики (DeepSeek / Gemini Flash) → фильтруем → полируем на Claude Sonnet.
- Для креатива thinking-модели не дают преимущества, а Claude лидирует в Problem Handling по FLASK.
- Я проверил креативность числом: одна фраза в промпте поднимает разброс ответов почти вдвое.
Характеры моделей по типам контента
У каждой модели свой «голос». Вот как я их развожу по задачам:
| Модель | Лучше всего для | Характер текста |
|---|
| Gemini 3 | образовательный контент, туториалы, объяснения | структурированный, логичный, педагогичный |
| Claude 4.5 | лонгриды, сторителлинг, Reels, адаптация под стиль | человеческий, тёплый, гибко настраиваемый |
| Grok | комментарии, неформальный контент, мемы | прямой, неформальный, дерзкий |
| DeepSeek / Qwen / Kimi | массовая генерация, черновики, переводы | нейтральный, хорошее цена/качество |
| ChatGPT (GPT-5) | техдокументация, мануалы, математика | формальный, не для русского креатива |

Рабочий пайплайн
Главная экономия не лить дорогую модель на всё подряд. Сначала много дешёвых черновиков, потом дорогой polish только на выживших.
| Этап | Модель | Почему |
|---|
| Массовая генерация | DeepSeek-V3.2 / Gemini 3 Flash | в 10–30 раз дешевле, качества для черновиков хватает |
| Фильтрация | базовые критерии | отсеять слабые сценарии: есть ли хук, держится ли структура |
| Финальный polish | Claude Sonnet 4.5 | живой текст без AI-штампов, низкий Slop Score, гибкая настройка стиля |
| A/B-оценка | Claude Sonnet | официальный judge в EQ-Bench, сбалансированная оценка |

Почему Claude на финале. Текст не звучит как генерация: низкий Slop Score, меньше GPT-измов вроде tapestry, delve, testament. Легко настраивается под нужный tone of voice и нормально тянет эмоциональные сценарии. По FLASK у него сильная Insightfulness в креативных задачах.
Почему DeepSeek / Gemini Flash на массе. Цена. У DeepSeek порядка $0.27/$1.10 за 1M токенов это в 30+ раз дешевле Claude. Для черновиков и отсева идей качества достаточно, а Gemini 3 Flash при этом держится в топ-3 Creative Writing на LMArena.
Что говорят бенчмарки
Это не только мои ощущения это цифры в ту же сторону.
LMArena, Creative Writing (январь 2026):
| # | Модель | Score |
|---|
| 1 | Gemini 3 Pro | 1488 |
| 2 | Claude Opus 4.5 | 1460 |
| 3 | Gemini 3 Flash | 1456 |
| 6 | Claude Sonnet 4.5 | 1443 |
| 10 | Grok 4.1 (thinking) | 1439 |
В категории Writing, Literature & Language порядок похожий: сверху Gemini 3 Pro и Flash, рядом Claude Opus 4.5 и Sonnet 4.5.
Специалисты против универсалов (Arena Expert). Arena Expert это сложные промпты от профессионалов, всего 5.5% всех запросов, но они лучше различают топовые модели. Расклад по доменам:
| Домен | Лучшая модель |
|---|
| Software & IT | Claude |
| Mathematical | Claude |
| Writing & Language | Gemini |
| Medicine | OpenAI |
| Лучший универсал | Gemini 2.5 Pro |
FLASK: 12 навыков вместо одной оценки. FLASK раскладывает модель на 12 отдельных навыков (Correctness, Insightfulness, Readability, Conciseness и т.д.) вместо одного общего балла. Для контента важны два вывода: Insightfulness и Comprehension критичны для сценариев Reels, а thinking-модели не дают преимущества в креативе. Claude при этом лидирует в Problem Handling среди проприетарных моделей.
Специфика Reels и иерархическая генерация
Reels отдельная история: короткий формат на 15–60 секунд, эмоциональный хук в первые 2 секунды, разговорный стиль, юмор, динамика. Под это и подбирается связка дёшево сгенерил дорого отполировал.
Здесь хорошо ложится старое исследование Facebook AI (2018) про иерархическую генерацию историй: сначала генерируется концепт (premise), потом на его основе полный текст. Люди предпочитают такой подход почти в два раза чаще (67% против 33%). Для Reels это значит: сначала хук и идея, потом полный сценарий. И ещё деталь top-k sampling (k=10) для креатива работает лучше, чем beam search.
Цены API
Разница в стоимости и есть главный аргумент за двухэтапный пайплайн:
| Модель | Input / 1M | Output / 1M |
|---|
| Claude Opus 4.5 | $15 | $75 |
| Claude Sonnet 4.5 | $3 | $15 |
| GPT-5.2 | ~$10–15 | ~$30–60 |
| Gemini 3 Pro | ~$3–5 | ~$10–15 |
| Gemini 3 Flash | ~$0.10–0.30 | ~$0.40–1.00 |
| DeepSeek-V3.2 | $0.27 | $1.10 |
Сотни вариантов на DeepSeek или Gemini Flash стоят копейки. Дорогой Claude видит только то, что прошло фильтр.
А можно ли измерить креативность числом?
Вся таблица характеров выше это пока качественные суждения: живой текст, низкий Slop Score. Мне захотелось подвести под это числа, поэтому я поставил отдельный эксперимент.
Взял два промпта, отличие ровно в одной фразе:
- Basic: Create 5 ideas of creative banners for performance marketing of an AI benchmarking platform.
- Creative: то же самое плюс Be as creative as possible.
Прогнал на 13 моделях из 4 семейств, на трёх температурах (0 / 0.5 / 1), по 10 раз на связку. Для каждого ответа считал эмбеддинг, а внутри набора брал максимальное попарное расстояние между эмбеддингами это и есть мера разброса ответов (как прокси креативности).
| Промпт | scatter (cosine) | scatter (manhattan) |
|---|
| basic | 0.286 | 37.4 |
| creative | 0.569 | 52.8 |
Одна фраза и разброс по cosine почти удваивается. Это устойчивый сдвиг, а не шум. А вот с температурой всё неоднозначно: максимальный разброс у creative-промпта оказался на нуле, и разные модели реагируют на температуру по-разному. То есть «крутить температуру вверх ради креатива» работает не всегда.

Чего этот подход не умеет
Честно про ограничения. Разброс эмбеддингов нормальный прокси креативности для идей и креативов, но для фактологии и кода он бессмыслен. Числа зависят от модели эмбеддингов, так что читать их стоит как относительные. Выборка маленькая (10 прогонов на конфигурацию). И главное разброс не равен пользе: высокое разнообразие может включать нерелевантные идеи, поэтому метрику надо комбинировать с фильтрами качества. Плюс модели постоянно обновляются, и оценки со временем дрейфуют.
Итог для генерации контента
Если коротко, мой рецепт такой:
- Массовая генерация Gemini 3 Flash или DeepSeek-V3.2, экономия 90%+ бюджета.
- Фильтрация отсечь слабые сценарии по хуку и структуре.
- Финальная доводка Claude Sonnet 4.5 для polish и адаптации под стиль.
- Оценка реальные метрики engagement + Slop Score + A/B-тесты.
Вывод: не ищите одну модель на все случаи. Дешёвые дают объём и разнообразие, Claude приводит лучшее в порядок, а иерархический подход (сначала хук → потом сценарий) собирает всё вместе. И там, где раньше было «на глаз», уже можно ставить числа.
Источники
Если вам понравилась заметка подписывайтесь на мой канал в телеграме https://t.me/renat_alimbekov