К КраїнаНовини України щогодини

AI-агенти для бізнесу: чому ціна помилки важливіша за бенчмарки

·785 слівредакція
AI-агенти для бізнесу: чому ціна помилки важливіша за бенчмарки

Засновник Bitmedia Labs Матвій Дядьков проаналізував 33 моделі від 15 провайдерів і дійшов висновку: найрозумніша модель не завжди найвигідніша для бізнесу. Все впирається в ціну помилки.

Бенчмарки перевіряють модель, а не ваш бізнес-процес. У своєму pet project, агентській системі для моніторингу нішевого ринку, Дядьков поставив топову модель із верхівки рейтингів. Вона видала переконливий звіт, але на фактчеку з'ясувалося: ключову оцінку вартості вона просто вигадала, а комісію майданчика порахувала неправильно. У бенчмарку це мінус кілька балів, у реальному житті — мінус гроші.

Тому в задачах, пов'язаних із грошима, підприємець закладає окремий шар перевірки. Топова модель у результаті коштує дорожче, ніж у прайсі: до API додаються перевірки, повторні виклики й час людини.

Ціна помилки має напряму визначати рівень автономності агента. Якщо він готує чернетку внутрішнього документа, може працювати майже самостійно — помилку перепишуть. Інша справа — SQL-запити, зміна коду, робота з платежами чи персональними даними. Тут потрібні sandbox, автоматичні перевірки, журналювання дій і точки, де рішення підтверджує людина. Неправильний абзац можна переписати, а неправильна команда в базі даних може видалити інформацію.

Принцип Дядькова простий: дорога модель думає, дешева працює. В його агентській системі оркестратор на Claude Opus викликається рідко, але приймає складні рішення, а сканер на Sonnet цілодобово перебирає дані — там важливіша ціна за запит. Схоже закладають в AI-генератор банерів у Bitmedia Labs: сильна модель створює банер, дешевша перевіряє якість і відповідність рекламним правилам.

Multi-model підхід має сенс, коли вже є обсяг і метрики. А от будувати «зоопарк» моделей на старті Дядьков не радить: кожна модель — це окремі промпти, версії та способи зламатися. Його правило: стартуйте з однієї моделі й розділяйте систему, коли цифри покажуть, навіщо.

Він починає будувати агентську систему не з вибору моделі, а з процесу: що робить агент, де може фейлити, що станеться після помилки і чи можна відкотити дію. Тільки коли з'являються реальні метрики, є сенс ускладнювати систему.

Регіон теж може змінити правильну відповідь. У AI-платформі для продажу вживаних авто для ринку MENA головною проблемою стала мова. Бенчмарки з арабської побудовані на літературній мові, а реальні користувачі в країнах Затоки пишуть діалектом, змішують арабську з англійською, використовують латиницю та локальний автомобільний сленг. Моделі, які добре виглядали в рейтингах, саме на таких запитах починали помилятися. Другий фактор — дані: маркетплейс працює з персональною інформацією, тож передавати все через зовнішні API в іншому регіоні не найкращий варіант. Архітектура вийшла багаторівневою: легка швидка модель перетворює запит на структуровані фільтри, сильніша підключається лише там, де потрібен reasoning, а основну модель хочуть тримати під власним контролем, аж до self-hosted open-weight рішення.

У реальному продукті найкраща модель не та, що має найвищий score, а та, яка дає потрібний результат за прийнятну ціну помилки.

Читайте також