testpilot · 1С:ERP · 26.09 и 29.09.2026

Марафон testpilot: Claude и Codex на одном сценарии

Один «неразумно сложный» сценарий из четырех форм цепочкой, с шестью ловушками. 26.09 три субагента Claude шли параллельно, каждый на своем тест-клиенте. 29.09 тот же сценарий с тем же промптом прошел Sonnet 5.5 в двух вариантах effort, тоже параллельно. В тот же день сценарий по очереди прошел Codex CLI на GPT-6 Sol и GPT-6 Luna, каждый в чистом сеансе. Документы всех, кто дошел до конца, сверены запросом к базе.

Sonnet 5.5 на high прошел все 16 точек. GPT-6 Sol на medium набрал 15,5 точки за $2,31 и стал самым дешевым за точку среди дошедших до конца. Сбился он только на ловушке с видом цены, взял ее со второго захода и сам записал шаг как провал. GPT-6 Luna на medium честно остановился на той же ловушке, а на high прошел все 16 точек за $0,24, но медленнее всех — 17 минут. Haiku остановился на шаге 4 и отметил непройденные шаги как пройденные.

Контрольные точки

16 точек по протоколам и по базе. Частично — точка взята со второй попытки, обходным путем, который увел в сторону, или вердикт «прошел» стоит рядом с честно записанным расхождением.

Стоимость прогона

Доллары по ценам API. Почти всё — повторное чтение контекста из кеша на каждом ходе.

чтение кеша запись в кеш / новый вход выход

Время прогона

Минуты от первого до последнего хода. Claude шли параллельно двумя волнами: 26.09 три модели за 13,5 минуты по часам, 29.09 два Sonnet 5.5 за 9 минут. Codex шел по одному прогону; GPT-6 Luna high — самый долгий, 17 минут.

Уникальные токены

Каждый токен посчитан один раз: новый вход, запись в кеш и выход. Повторные чтения кеша сюда не входят. Около 97 тыс. — общий стартовый контекст агента Claude. Для Codex это новый вход плюс выход.

Цена одной контрольной точки

Стоимость прогона, деленная на набранные баллы. Haiku ничего не проверил и обошелся дороже всех. GPT-6 Luna дешевле всех за точку, но его точки только с первых шагов. Цену точки стоит сравнивать между прогонами, дошедшими до конца.

Цифры целиком

Токены сняты из журналов субагентов, повторы одного сообщения схлопнуты по его идентификатору. Цены за 1 млн токенов: Opus 5.5 — $4 вход / $20 выход, Sonnet 5 и Sonnet 5.5 — $2 / $10, Haiku 4.5 — $1 / $5, GPT-6 Sol — $2 / $10, GPT-6 Luna — $0,10 / $0,50. Запись в кеш — 1,25 цены входа. Чтение кеша у Opus 5.5 — 0,05 цены входа, у остальных — 0,1. Журнал Codex отдает только новый вход, чтение кеша и выход, запись в кеш в нем не видна, поэтому новый вход посчитан по цене входа. Контекст Codex не превышал 272 тыс., длинный тариф не применялся. Codex работал в своей оболочке со своим системным промптом, поэтому сравнивается связка агента и модели, а не модель в чистом виде. В первой версии отчета Opus считался по 0,1, и его стоимость была завышена: $9,78 вместо $5,66. Effort у Opus 5.5 и Sonnet 5 был medium из настроек Claude Code; у Sonnet 5.5 задан явно определением агента. Шкала effort у Sonnet 5.5 перекалибрована, medium у двух Sonnet не равнозначен. Мой собственный пробный прогон в сумму не входит.

Сценарий

Цепочка «заказ → рабочее место счетов → счет → оплата» и обратно по окнам. Ловушки в тексте сценария не раскрыты.

  1. Прямой вход в счет на оплату. Система отказывает, текст читается из окна ошибки.
  2. Клиент. Сначала несуществующий партнер, потом выбор через форму выбора.форма выбора пустаядва похожих поля
  3. Три строки товаров, в третьей нет количества.цену не ввести при виде цены
  4. Проведение с ошибкой: удалить строку, сменить количество, сверить суммы и НДС.
  5. Проведение и снимок формы: что поменялось после записи.
  6. Отказ от сохранения и проверка переоткрытием.
  7. Накладная на основании. Действие «Ship» в строках, повторная попытка.список без ввода текстомдиалог на три кнопки
  8. Счет на основании через рабочее место с этапами оплаты.
  9. Оплата на основании счета: нулевая сумма, затем частичная оплата 1 000 USD с ручным пересчетом в рубли.скрытые обязательные поля
  10. Обратный путь по окнам: к оплате 700, оплачивается 1 000.
  11. Итог в списке заказов: сумма 1 700 и 59 % оплаты.