AI-агенти для бізнесу: чому ціна помилки важливіша за бенчмарки

Засновник Bitmedia Labs Матвій Дядьков проаналізував 33 моделі від 15 провайдерів і дійшов висновку: найрозумніша модель не завжди найвигідніша для бізнесу. Все впирається в ціну помилки.
Бенчмарки перевіряють модель, а не ваш бізнес-процес. У своєму pet project, агентській системі для моніторингу нішевого ринку, Дядьков поставив топову модель із верхівки рейтингів. Вона видала переконливий звіт, але на фактчеку з'ясувалося: ключову оцінку вартості вона просто вигадала, а комісію майданчика порахувала неправильно. У бенчмарку це мінус кілька балів, у реальному житті — мінус гроші.
Тому в задачах, пов'язаних із грошима, підприємець закладає окремий шар перевірки. Топова модель у результаті коштує дорожче, ніж у прайсі: до API додаються перевірки, повторні виклики й час людини.
Ціна помилки має напряму визначати рівень автономності агента. Якщо він готує чернетку внутрішнього документа, може працювати майже самостійно — помилку перепишуть. Інша справа — SQL-запити, зміна коду, робота з платежами чи персональними даними. Тут потрібні sandbox, автоматичні перевірки, журналювання дій і точки, де рішення підтверджує людина. Неправильний абзац можна переписати, а неправильна команда в базі даних може видалити інформацію.
Принцип Дядькова простий: дорога модель думає, дешева працює. В його агентській системі оркестратор на Claude Opus викликається рідко, але приймає складні рішення, а сканер на Sonnet цілодобово перебирає дані — там важливіша ціна за запит. Схоже закладають в AI-генератор банерів у Bitmedia Labs: сильна модель створює банер, дешевша перевіряє якість і відповідність рекламним правилам.
Multi-model підхід має сенс, коли вже є обсяг і метрики. А от будувати «зоопарк» моделей на старті Дядьков не радить: кожна модель — це окремі промпти, версії та способи зламатися. Його правило: стартуйте з однієї моделі й розділяйте систему, коли цифри покажуть, навіщо.
Він починає будувати агентську систему не з вибору моделі, а з процесу: що робить агент, де може фейлити, що станеться після помилки і чи можна відкотити дію. Тільки коли з'являються реальні метрики, є сенс ускладнювати систему.
Регіон теж може змінити правильну відповідь. У AI-платформі для продажу вживаних авто для ринку MENA головною проблемою стала мова. Бенчмарки з арабської побудовані на літературній мові, а реальні користувачі в країнах Затоки пишуть діалектом, змішують арабську з англійською, використовують латиницю та локальний автомобільний сленг. Моделі, які добре виглядали в рейтингах, саме на таких запитах починали помилятися. Другий фактор — дані: маркетплейс працює з персональною інформацією, тож передавати все через зовнішні API в іншому регіоні не найкращий варіант. Архітектура вийшла багаторівневою: легка швидка модель перетворює запит на структуровані фільтри, сильніша підключається лише там, де потрібен reasoning, а основну модель хочуть тримати під власним контролем, аж до self-hosted open-weight рішення.
У реальному продукті найкраща модель не та, що має найвищий score, а та, яка дає потрібний результат за прийнятну ціну помилки.
Читайте також
Ще в розділі «Економіка»
- У Луцьку гіпермаркет «Там Там» працюватиме до 23:00 — але з нюансом
- ШІ створює новий робітничий бум: чому сантехніки та електрики стають ціннішими за офісних фахівців
- Нафта знову дорожчає: нові удари США та Ірану підігріли страх за постачання
- На Буковині 12-річний хлопець на мопеді збив пенсіонерку
- Тепличний комплекс із полуницею на Київщині продають за $11 млн





