Разборы, кейсы и практика для инженеров и продактов. Как строить AI-продукты и не терять на этом деньги.

Выбор LLM для генерации контента: характеры моделей

Выбор LLM для генерации контента» с чипами моделей Gemini, Claude, DeepSeek, GPT и Grok

За последний год я перепробовал десяток моделей на реальной генерации контента от Reels-сценариев до лонгридов. Вывод простой и немного неудобный: универсальной лучшей модели нет. У каждой свой характер, и выбор зависит от типа контента и аудитории.

В этом посте как я подбираю модель под задачу, какой пайплайн гоняю в продукте и чем это подкреплено: данными LMArena, FLASK, Arena Expert и собственным экспериментом по измерению креативности.

Коротко

  • Нет лучшей модели есть характеры. Gemini объясняет, Claude рассказывает, DeepSeek штампует дёшево, GPT строг и формален.
  • Рабочий пайплайн: дёшево генерим черновики (DeepSeek / Gemini Flash) → фильтруем → полируем на Claude Sonnet.
  • Для креатива thinking-модели не дают преимущества, а Claude лидирует в Problem Handling по FLASK.
  • Я проверил креативность числом: одна фраза в промпте поднимает разброс ответов почти вдвое.

Характеры моделей по типам контента

У каждой модели свой «голос». Вот как я их развожу по задачам:

МодельЛучше всего дляХарактер текста
Gemini 3образовательный контент, туториалы, объясненияструктурированный, логичный, педагогичный
Claude 4.5лонгриды, сторителлинг, Reels, адаптация под стильчеловеческий, тёплый, гибко настраиваемый
Grokкомментарии, неформальный контент, мемыпрямой, неформальный, дерзкий
DeepSeek / Qwen / Kimiмассовая генерация, черновики, переводынейтральный, хорошее цена/качество
ChatGPT (GPT-5)техдокументация, мануалы, математикаформальный, не для русского креатива
Таблица характеров LLM: под какой контент подходят Gemini, Claude, Grok, DeepSeek и GPT

Рабочий пайплайн

Главная экономия не лить дорогую модель на всё подряд. Сначала много дешёвых черновиков, потом дорогой polish только на выживших.

ЭтапМодельПочему
Массовая генерацияDeepSeek-V3.2 / Gemini 3 Flashв 10–30 раз дешевле, качества для черновиков хватает
Фильтрациябазовые критерииотсеять слабые сценарии: есть ли хук, держится ли структура
Финальный polishClaude Sonnet 4.5живой текст без AI-штампов, низкий Slop Score, гибкая настройка стиля
A/B-оценкаClaude Sonnetофициальный judge в EQ-Bench, сбалансированная оценка
Схема пайплайна генерации контента: массовая генерация на DeepSeek и Gemini Flash, фильтрация и финальный polish на Claude Sonnet

Почему Claude на финале. Текст не звучит как генерация: низкий Slop Score, меньше GPT-измов вроде tapestry, delve, testament. Легко настраивается под нужный tone of voice и нормально тянет эмоциональные сценарии. По FLASK у него сильная Insightfulness в креативных задачах.

Почему DeepSeek / Gemini Flash на массе. Цена. У DeepSeek порядка $0.27/$1.10 за 1M токенов это в 30+ раз дешевле Claude. Для черновиков и отсева идей качества достаточно, а Gemini 3 Flash при этом держится в топ-3 Creative Writing на LMArena.

Что говорят бенчмарки

Это не только мои ощущения это цифры в ту же сторону.

LMArena, Creative Writing (январь 2026):

#МодельScore
1Gemini 3 Pro1488
2Claude Opus 4.51460
3Gemini 3 Flash1456
6Claude Sonnet 4.51443
10Grok 4.1 (thinking)1439

В категории Writing, Literature & Language порядок похожий: сверху Gemini 3 Pro и Flash, рядом Claude Opus 4.5 и Sonnet 4.5.

Специалисты против универсалов (Arena Expert). Arena Expert это сложные промпты от профессионалов, всего 5.5% всех запросов, но они лучше различают топовые модели. Расклад по доменам:

ДоменЛучшая модель
Software & ITClaude
MathematicalClaude
Writing & LanguageGemini
MedicineOpenAI
Лучший универсалGemini 2.5 Pro

FLASK: 12 навыков вместо одной оценки. FLASK раскладывает модель на 12 отдельных навыков (Correctness, Insightfulness, Readability, Conciseness и т.д.) вместо одного общего балла. Для контента важны два вывода: Insightfulness и Comprehension критичны для сценариев Reels, а thinking-модели не дают преимущества в креативе. Claude при этом лидирует в Problem Handling среди проприетарных моделей.

Специфика Reels и иерархическая генерация

Reels отдельная история: короткий формат на 15–60 секунд, эмоциональный хук в первые 2 секунды, разговорный стиль, юмор, динамика. Под это и подбирается связка дёшево сгенерил дорого отполировал.

Здесь хорошо ложится старое исследование Facebook AI (2018) про иерархическую генерацию историй: сначала генерируется концепт (premise), потом на его основе полный текст. Люди предпочитают такой подход почти в два раза чаще (67% против 33%). Для Reels это значит: сначала хук и идея, потом полный сценарий. И ещё деталь top-k sampling (k=10) для креатива работает лучше, чем beam search.

Цены API

Разница в стоимости и есть главный аргумент за двухэтапный пайплайн:

МодельInput / 1MOutput / 1M
Claude Opus 4.5$15$75
Claude Sonnet 4.5$3$15
GPT-5.2~$10–15~$30–60
Gemini 3 Pro~$3–5~$10–15
Gemini 3 Flash~$0.10–0.30~$0.40–1.00
DeepSeek-V3.2$0.27$1.10

Сотни вариантов на DeepSeek или Gemini Flash стоят копейки. Дорогой Claude видит только то, что прошло фильтр.

А можно ли измерить креативность числом?

Вся таблица характеров выше это пока качественные суждения: живой текст, низкий Slop Score. Мне захотелось подвести под это числа, поэтому я поставил отдельный эксперимент.

Взял два промпта, отличие ровно в одной фразе:

  • Basic: Create 5 ideas of creative banners for performance marketing of an AI benchmarking platform.
  • Creative: то же самое плюс Be as creative as possible.

Прогнал на 13 моделях из 4 семейств, на трёх температурах (0 / 0.5 / 1), по 10 раз на связку. Для каждого ответа считал эмбеддинг, а внутри набора брал максимальное попарное расстояние между эмбеддингами это и есть мера разброса ответов (как прокси креативности).

Промптscatter (cosine)scatter (manhattan)
basic0.28637.4
creative0.56952.8

Одна фраза и разброс по cosine почти удваивается. Это устойчивый сдвиг, а не шум. А вот с температурой всё неоднозначно: максимальный разброс у creative-промпта оказался на нуле, и разные модели реагируют на температуру по-разному. То есть «крутить температуру вверх ради креатива» работает не всегда.

Графики разброса ответов LLM (cosine и manhattan) по температуре: creative-промпт выше basic на всех точках

Чего этот подход не умеет

Честно про ограничения. Разброс эмбеддингов нормальный прокси креативности для идей и креативов, но для фактологии и кода он бессмыслен. Числа зависят от модели эмбеддингов, так что читать их стоит как относительные. Выборка маленькая (10 прогонов на конфигурацию). И главное разброс не равен пользе: высокое разнообразие может включать нерелевантные идеи, поэтому метрику надо комбинировать с фильтрами качества. Плюс модели постоянно обновляются, и оценки со временем дрейфуют.

Итог для генерации контента

Если коротко, мой рецепт такой:

  1. Массовая генерация Gemini 3 Flash или DeepSeek-V3.2, экономия 90%+ бюджета.
  2. Фильтрация отсечь слабые сценарии по хуку и структуре.
  3. Финальная доводка Claude Sonnet 4.5 для polish и адаптации под стиль.
  4. Оценка реальные метрики engagement + Slop Score + A/B-тесты.

Вывод: не ищите одну модель на все случаи. Дешёвые дают объём и разнообразие, Claude приводит лучшее в порядок, а иерархический подход (сначала хук → потом сценарий) собирает всё вместе. И там, где раньше было «на глаз», уже можно ставить числа.

Источники


Если вам понравилась заметка подписывайтесь на мой канал в телеграме https://t.me/renat_alimbekov

Share it
Ренат Алимбеков
Ренат Алимбеков — ML-инженер и консультант, 18 лет в IT. Провожу ML/Data Science консультации и менторинг по Data Science — онлайн и очно в Алматы.
Понравилась заметка? Подписывайтесь на телеграм — @renat_alimbekov.

Интересные записи в этой рубрике: