Хроники Дилера
Инструкция·04.10.2026·15 мин

GPT-6 Sol и Claude Opus 5.5: что реально работает для маркетолога

Две стальные турбины на верстаке, меньшая рабочая подсвечена на рекламном листе, большая простаивает рядом
Что узнаешь
  • Готовый ответ, какую из трёх моделей брать под рекламный текст, а какую под обработку заявок
  • Разбор цены в долларах и ловушки длинного контекста у Sol, из-за которой счёт растёт незаметно
  • Чек-лист из моего рабочего фильтра «меньше магии, больше метрик» под любую новую модель
  • Трезвый взгляд на доступ из России без переплаты вслепую
Применить за 30 мин
Средний
3просмотров

22 сентября индустрия выкатила Claude Opus 5.5 и пару GPT-6 Sol и Luna почти встык, и в лентах моментально начался спор, кто кого обходит по бенчмаркам. Я на такие споры смотрю с одной меркой, что из этого даст деньги и системность в реальной работе директолога и таргетолога, а не в очередной таблице с процентами.

Свежие разборы моделей без пены и с готовыми решениями я выкладываю в своём Telegram-канале «The Maslov». Если хотите получать их раньше, чем волна хайпа осядет, загляните туда.

Что случилось 22 сентября: два релиза в один день

22 сентября 2026 года Anthropic выпустила Claude Opus 5.5, а в тот же день OpenAI показала пару GPT-6 Sol и GPT-6 Luna под флагманом GPT-6 Astra. Для маркетолога это значит одно, выбор моделей стал шире, а времени разобраться, что менять в работе, стало меньше.

Anthropic про Opus 5.5 говорит прямо, модель «performs at the level of Claude Fable 5.1 on most work», то есть на большинстве задач тянет на уровне более дорогой Claude Fable 5.1, и при этом дешевле в эксплуатации, чем прошлый Opus 5. OpenAI ставит Sol на сложную повторяющуюся работу, а Luna на высокообъёмные простые задачи вроде выжимок из документов и быстрых ответов. Обе линейки заметно подешевели относительно прошлого поколения.

Предыдущую GPT-6 Astra я уже прогонял через тот же рабочий фильтр и отвечал, стоит ли фрилансеру за неё переплачивать. Здесь задача та же, только моделей стало три, и все три метят в разные части работы. Дальше разбираю каждую по делу.

Чем отличаются GPT-6 Sol и GPT-6 Luna?

GPT-6 Sol и Luna собраны под разный объём работы, и в этом вся разница. Первая тянет сложную повторяющуюся работу и рассуждения там, где нужен диалог и уточнения. Вторая заточена под поток простых однотипных задач вроде разметки заявок и стоит копейки, вход у неё дешевле входа Sol в двадцать раз.

У обеих моделей контекстное окно около 1,05 миллиона токенов (922 тысячи на вход и 128 тысяч на выход), поддержка текста и картинок и регулятор усилия на рассуждения от none до max, по умолчанию medium. Регулятор нужен, чтобы не платить за глубокое размышление там, где задача простая. Для разметки заявки на «горячий или холодный» max-усилие только жжёт деньги и время, а результат тот же.

Sol в работе с текстом ведёт себя лаконичнее старшего Opus, и это её сильная сторона там, где важна первая строка. Luna берёт другим, ценой. Это одна из самых дешёвых моделей, что вообще выходили у OpenAI, и её место там, где заявок сотни, а решение по каждой простое и однотипное.

Sol собрана под сложную повторяющуюся работу, Luna - под высокий объём простых задач, поэтому под рекламный текст и под массовую разметку заявок это разные инструменты, а не «дорогой и дешёвый вариант одного и того же».

Что нового у Claude Opus 5.5 по цене и скорости?

Opus 5.5 стал дешевле и быстрее предшественника, оставшись верхней моделью по качеству. Вход стоит 4 доллара за миллион токенов, выход 20 долларов, это на 40% дешевле в эксплуатации, чем прошлый Opus 5. Генерация более чем на 30% быстрее, а лимит вывода прежний, 128 тысяч токенов.

В самом релизе Anthropic размер входного окна отдельно не называет, но в документации оно указано, около миллиона токенов на вход. Что важнее для практики, сама Anthropic в релизе оговаривается прямой цитатой «At these levels of capability we've found that benchmark margins have become a less reliable guide to real-world differences». Проще говоря, вендор сам признаёт, что разрыв в баллах бенчмарков теперь значит меньше, чем раньше, и слепо верить цифрам из таблицы не стоит.

Когда полгода назад выходил Claude Opus 5, я уже разбирал, что смена версии меняет для маркетолога и во сколько обходится юнит работы в моём конвейере. Логика та же и сейчас, новая версия дешевле и быстрее, но вопрос всё равно один, окупает ли она себя на конкретной задаче.

Такие прогоны новых моделей под конкретные задачи трафика я превращаю в готовые связки и шаблоны для работы. Разборы с выводом, что брать в дело, а что в архив, выкладываю в своём Telegram-канале «The Maslov». Если тестировать каждый релиз самому некогда, забирайте готовое там.

Разборы новых моделей - в Telegram

Подписаться на «The Maslov»

Почему бенчмарки релиза ничего не говорят о рекламном тексте?

Потому что заголовочные бенчмарки меряют кодинг и работу агентов с инструментами, а не качество продающего текста. Terminal-Bench, Intelligence Index и подобные наборы никак не связаны с тем, зацепит ли ваша первая строка холодного человека в ленте, а именно за это вам платит клиент.

Посмотрите на сами цифры. По независимому замеру Artificial Analysis на максимальном усилии Opus 5.5 набрал 58 баллов Intelligence Index против 48 у Sol. А на наборе Browser Use картина переворачивается, там уже Sol впереди с 66,9 против 59 у Opus 5.5. Победитель меняется в зависимости от того, чьей методике вы верите, и это должно настораживать.

Есть и прямая нестыковка по письму. Тот же Opus 5.5 в независимых разборах и хвалят за читаемость среди свежих флагманов, и тут же отмечают, что он «закапывает мысль», тратя заметно больше предложений на то, что человек-редактор укладывает в пару абзацев. Для статьи это терпимо, а для рекламного текста, где решает первая строка, читаемость и умение сразу выдать суть, это разные вещи, и по второму параметру старшая модель проседает.

Отсюда простой вывод, разбор релиза через кодинг-бенчмарки вам как маркетологу не поможет. Помогает только собственный прогон на своей задаче. Дальше показываю, как гоняю модели сам.

Как я тестировал три модели на реальных маркетинговых задачах

Новую модель я проверяю своим рабочим фильтром, одинаковым для любого инструмента. Схема простая, сначала исследование, потом прототип, потом короткий боевой пилот на реальной нише, и только если цифры подтвердились, появляется регламент для команды. Ощущения «вроде пишет бодрее» в этот фильтр не проходят.

Под ключевую задачу за пару-тройку дней собирается черновой стек, а дальше две-четыре недели живого пилота в реальной нише. Любая новая модель проходит через один и тот же чек-лист. Про себя я называю его «меньше магии, больше метрик».

  1. CPA (цена целевого действия), ROMI (окупаемость вложений в маркетинг) и скорость цикла работы. Экономит ли модель деньги и время на конкретной операции.
  2. Доля рутины, которую она реально снимает с рук на практике.
  3. Риски галлюцинаций. Насколько дорого стоит её ошибка в этой задаче.
  4. Контроль качества вывода. Можно ли проверить результат быстро и повторяемо.

Я держу для этого «слепые» спринты на время. Беру одну и ту же задачу, прогоняю на новой модели и на прошлой версии, сравниваю по метрикам, вместо ощущения «вроде бодрее пишет». Так же прогнал и эту тройку. Дальше не пересказ бенчмарков, а результат двух прогонов на задачах, которые кормят большинство из нас, на написании рекламного текста и на обработке входящих заявок.

Отдельно сразу оговорюсь про фактуру. Все конкретные цифры дальше это либо цены из официальных релизов, либо независимые замеры вроде Artificial Analysis и практических прогонов сторонних тестировщиков. Собственные наблюдения из своих прогонов я даю как наблюдения, без придуманной точности.

GPT-6 Sol или Claude Opus 5.5: кто лучше пишет рекламный текст?

Под рекламный текст я беру GPT-6 Sol, а Opus 5.5 держу для длинных аналитических кусков. Причина в том, что рекламное объявление живёт за счёт первой строки и краткости, а именно в краткости старшая модель проседает и раздувает мысль на лишние предложения.

В моих прогонах Sol выдаёт более собранный текст, короткий заход, понятный оффер, меньше воды после первого предложения. Opus 5.5 пишет гладко и приятно читается, но раздувает мысль. Это подтверждается и со стороны, по замеру Artificial Analysis, Opus 5.5 стоит около сотого места из более чем двух сотен по многословности и выдал около 260 миллионов токенов на тестовом наборе против медианных 88 миллионов. Для рекламного объявления, где на счету каждое слово, это прямой минус, который вы будете вычищать руками.

При этом Opus 5.5 идёт выше по независимым замерам качества, по Intelligence Index Artificial Analysis у него 58 баллов против 48 у Sol. На разовую рекламную формулировку, где важна юридическая точность и цена ошибки высока, я эту надёжность возьму. А для потока черновиков объявлений, которые я всё равно правлю сам, перевешивает разница в цене, Sol вдвое дешевле по токенам.

По деньгам разрыв ещё нагляднее в связке качество плюс время. По данным отдельного практического теста стороннего блогера, не связанного с замером Artificial Analysis, старшая модель понравилась почти везде, но потратила около восьми с половиной часов и порядка 213 долларов, тогда как более дешёвая модель закрыла сопоставимый набор за шесть часов и около 74 долларов. Преимущество по качеству вы покупаете кратным ростом времени и счёта.

Для рекламного текста лаконичность и цена Sol перевешивают, а Opus 5.5 стоит доставать под длинную аналитику и формулировки, где ошибка дорогая.

Кто быстрее и надёжнее обрабатывает заявки - Sol, Luna или Opus 5.5?

Под массовую обработку и первичную квалификацию заявок я беру Luna, а не флагманы. Задача тут простая и однотипная, а решают скорость и цена ответа, помноженные на объём, тогда как «ум» модели вторичен. Держать на таком потоке дорогой флагман, значит жечь бюджет на мощность, которая себя тут не отбивает.

Почему скорость важнее ума, объясню на своём замере. Заявку, обработанную в первые десять минут, я закрываю в целевые примерно на 80-90%. Из тех же заявок через два часа после поступления в целевые попадает от силы 20-30%.

Несвоевременная обработка это одна из самых болючих болей практически всего бизнеса в РФ, лид остывает или вообще забывает, что оставлял заявку. Даже идеальный трафик такая обработка обнуляет. Поэтому под первый быстрый контакт нужна дешёвая и быстрая модель, которую не жалко держать на потоке круглосуточно.

Luna сюда ложится лучше всех. Она из самых дешёвых моделей OpenAI и собрана ровно под высокий объём простых задач, разметить заявку, вынуть телефон и суть обращения, отсеять заведомо нецелевые заявки. Sol я подключаю там, где квалификация посложнее и нужен диалог с уточняющими вопросами. Opus 5.5 на этой задаче держать смысла нет, вы переплатите за мощность, которая тут не работает.

Одна оговорка про надёжность на большом потоке заявок. Любая модель иногда ошибается, и для разового текста это некритично, но автоответчик обрабатывает сотни заявок одинаково, и скрытая доля ошибок накапливается, пока не долетит до жалоб клиентов. Поэтому диалоговый агент с квалификацией у меня всегда идёт с быстрой ручной подхваткой менеджером и отчётами по лидам, без режима чёрного ящика без присмотра.

Сколько это будет стоить директологу и таргетологу на практике?

Дешевле, чем пугают заголовки про флагманы, но только если вы подбираете модель под задачу, а не гоняете всё на самой дорогой. Разброс цен между моделями кратный, у Luna выход дешевле, чем у Opus 5.5, в сорок раз, и на объёме эта разница превращается в реальные деньги.

Вот официальные цены из релизов, за миллион токенов.

Claude Opus 5.5, вход/выход за 1М токенов
$4 / $20
GPT-6 Sol, вход/выход за 1М токенов
$2 / $10
GPT-6 Luna, вход/выход за 1М токенов
$0.10 / $0.50
релизы Anthropic и OpenAI, 22 сентября 2026

Разница между Opus 5.5 и Luna по выходу сорокакратная. Отсюда и главный антипаттерн, брать дорогой флагман под простую высокообъёмную задачу вроде тегирования заявок, где дешёвая модель справится не хуже и в десятки раз дешевле.

У Sol есть отдельная ловушка, о которой в релизе легко проскочить мимо.

При превышении 272 тысяч токенов на входе весь запрос пересчитывается по тарифу длинного контекста, и входная ставка Sol удваивается до 4 долларов за миллион.

Словить это проще, чем кажется. Если вы собираете агента и в один промпт подкладываете всю историю переписки с лидом или большой массив конкурентных объявлений, вы легко перешагнёте порог и незаметно начнёте платить вдвое за вход. Лечится это дисциплиной на входе, режьте контекст, не суйте в один запрос всё подряд, выносите справочную фактуру в отдельный слой.

Если считать по-человечески, то математика такая. Когда вы прогоняете тысячу коротких заявок в день через дешёвую Luna, вход и выход стоят копейки, и модель окупается на первой же спасённой заявке. Когда вы гоните тот же объём через флагман на усилии по умолчанию, вы переплачиваете десятки раз и не получаете за это ничего, кроме счёта. Какие AI-инструменты и по какой цене реально подъёмны небольшому агентству из одного-пяти человек, я отдельно разобрал по деньгам, там та же логика подбора под бюджет.

Можно ли доверить рутину модели без присмотра человека?

Нет, полностью без присмотра пока нельзя, и релиз это не меняет. Часть ошибок у любой из трёх моделей остаётся скрытой, и на потоке она накапливается незаметно, пока не проявится в виде претензии клиента. Поэтому доступ к деньгам и рекламным кабинетам модель без человека у меня не получает.

Возьмём надёжность. Любая из трёх моделей иногда промахивается, и для одного текста один-два промаха вы поймаете глазами. А вот автоответчик обрабатывает сотни обращений одинаково, и та же доля ошибок превращается там в систему, о которой вы услышите последним, уже по жалобам клиентов. Поэтому усилие на рассуждения по умолчанию тоже стоит проверять руками, потому что на классификации оно лишнее, а на спорной заявке его иногда не хватает.

Моё правило простое. Любой генератив идёт через чек-листы, факт-базы и тесты, а то, что модель делает сама, должно легко проверяться и повторяться другим человеком по инструкции, а не держаться на одном волшебнике. Прежде чем выдать агенту доступ к деньгам и кабинетам, стоит закрыть базовую безопасность, какие лимиты и логи выставить и что мониторить, я собрал в отдельном чек-листе безопасности для агентов в лидогенерации. Скорость важнее идеальности, но контроль качества важнее скорости.

А что с доступом из России?

Официального доступа к моделям OpenAI и Anthropic из России нет по состоянию на 22 сентября 2026 года (подробный разбор в отдельной статье), ни один из двух вендоров не работает напрямую с российскими аккаунтами, и зарегистрироваться с российским номером не получится.

Посредники, которые перепродают доступ к этим моделям, существуют. Их условия и надёжность я не проверял и никого конкретного не рекомендую, курс в рублях у них гуляет, и его стоит сверять на месте, а не верить чужому скриншоту.

Общий принцип для новых моделей тот же, что я разбирал применительно к Claude, вопрос доступа решается отдельно от вопроса, окупает ли инструмент себя на конкретной задаче.

Что внедрять уже сейчас, а что оставить на потом?

Внедряйте разделение задач по моделям уже сейчас, это даёт эффект сразу и почти ничем не грозит бюджету. Дешёвая модель на поток заявок, средняя на рекламные черновики, дорогая на редкие сложные тексты. Всё остальное прогоняйте через свой фильтр, прежде чем ставить на поток.

Вот как я развёл три модели у себя:

  1. Luna. Берите под массовую первичную обработку и квалификацию заявок, где объём большой, а решение простое. Экономит больше всего именно на потоке.
  2. Sol. Берите под рекламные тексты и черновики офферов, где важна лаконичность и первая строка, и под квалификацию посложнее с диалогом.
  3. Opus 5.5. Держите под длинную аналитику, сложные формулировки и тексты, где цена ошибки высокая, а надёжность важнее скорости и цены.

А оставить на потом стоит слепую веру в бенчмарки и мечту про полностью автономного агента без присмотра. Каждую новую модель гоняйте по своему чек-листу, CPA и ROMI, доля снятой рутины, риски галлюцинаций, контроль качества. Если инструмент не даёт денег, скорости или качества на вашей задаче, он идёт в архив, а не на обложку. Это скучнее, чем спорить о баллах в ленте, но именно это оставляет деньги в кармане.

Источники

Если такие разборы новых моделей для трафика и лидогенерации вам в тему, забирайте их в моём Telegram-канале «The Maslov». Там я выкладываю связки, тесты нейросетей и рабочие шаблоны по мере того, как обкатываю их на реальных задачах.

The Maslov
Telegram-канал «The Maslov»: разборы связок, нейросети и лидогенерация, без воды, с готовыми решениями
Смотреть программу
Была ли статья полезной?
Евгений Маслов
Автор
Евгений Маслов
Практикующий маркетолог, 15+ лет в трафике

Работаю с лидогенерацией, SEO, автоматизацией воронок и нейросетями в маркетинге для фрилансеров и малого бизнеса.

Похожие статьи

Как отличить текст, написанный нейросетью: 80 признаков

Доверие читателей к машинному тексту рушится быстрее, чем поисковые алгоритмы успевают это заметить. Свёл три независимых источника в один тезис и короткий чек-лист проверки.

12 мин

Вайб-кодинг: где это ломается на практике, а не на демо-роликах

Разбор реальных провалов и рисков вайб-кодинга и чек-лист, как проверить AI-код без навыка чтения кода, прежде чем доверить ему деньги или данные.

16 мин

Как срезать расход токенов на 90% методом Spotify в Claude Code

Продакт Spotify заявил экономию токенов Claude Code на 90 процентов через принудительные хуки. Разбираю, где цифра честная, а где маркетинг, и как повторить принцип без корпоративного Portal.

19 мин

Как сгенерировать изображение нейросетью, если нет дизайнера

Разбираю, чем генерировать картинки без дизайнера, как поставить задачу нейросети без типовой пластмассы и как отличить ИИ-изображение от настоящего фото.

16 мин
Подписка

Новые статьи — в Telegram

Раз в неделю подборка свежих разборов в канале.