
«Нові PRD – це евали (оцінки)», – заявив минулого тижня на конференції VB Transform 2026 у Менло-Парку Хаві Аматріен, перший директор з питань ШІ та даних в Expedia Group. «Отже, ви кодуєте те, що хочете, щоб продукт робив, через свої оцінки, які можуть включати оцінки червоних команд (red teaming) та всілякі інші речі, що вже мають низку вимог безпеки. Таким чином, ви вже вбудовуєте це в PRD та документ дизайну продукту ще до того, як почнете кодувати».
Він розвинув цю думку: «Завдяки ШІ-допомозі або генерації коду, це буде майбутнє. Це якби все ваше мислення переходило в оцінки».
До свого призначення в Expedia в грудні 2025 року Аматріен був віце-президентом з питань ШІ та обчислювальних можливостей у Google, відповідаючи за платформи, що лежать в основі Gemini та Google Search. Він був наставником талантів, які згодом заснували Perplexity та Scale AI.
Дослідження VB Pulse від VentureBeat щодо прогалин в оцінюванні підсилило актуальність теми. Шістдесят шість відсотків із 157 опитаних підприємств вже дозволяють розгортання в продакшні без людського перегляду або працюють над цим протягом наступних 12 місяців, проте лише 5% повністю довіряють автоматизованим оцінкам, що приймають це рішення. Половина компаній відправили в продакшн агента, який пройшов внутрішні оцінки, але зазнав невдачі з реальним клієнтом.
Не дозволяйте обмеженням заважати зворотньому зв’язку
«Чим більше обмежень, штучних бізнес-правил та різноманітних правил ви впроваджуєте в систему, тим гірше», – зазначив Аматріен. «Не тільки тому, що вони крихкі, а й тому, що вони насправді спотворюють петлю зворотного зв’язку. Ви фактично упереджуєте користувача та зворотній зв’язок, який отримуєте від нього, і тоді ви вчитеся неправильно». Він назвав обмеження «необхідним злом» і сказав, що мета – мінімізувати їх вплив з часом.
Не всі учасники Transform погодилися. Інші спікери стверджували під час заходу, що дії з найвищим ризиком все ще вимагають дуже жорстких обмежень.
Expedia керує ШІ за допомогою трьох рівнів. Спочатку йдуть принципи, що широко комунікуються. «Мені подобається кодувати на дуже високому рівні, як я очікую прийняття рішень, тому що у великій організації буде багато розподілених рішень», – сказав Аматріен. «І іноді, якщо вам пощастить, ці принципи можуть бути вбудовані у вашу культуру. Але найчастіше, мій досвід показує, що це не так». Потім йдуть процеси та інструменти, що їх забезпечують. «Принципи гарно виглядають на зображенні на стіні, але вам потрібно надати їм ваги», – додав він. Автоматизація стоїть над обома.
На практиці це реалізується через те, що Expedia називає «контрольними точками випуску агентів» – перевірки, відкалібровані відповідно до ризику. «Управління має корелювати з ризиком», – зазначив Аматріен. «І якщо у вас є щось з низьким ризиком, вам не потрібно багато управління, щоб воно заважало. Але якщо є високий ризик, тоді вам потрібне більше управління. Це можна закодувати». Контрольні точки пов’язують раунди оцінювання, red teaming та перевірку безпеки з рівнем ризику кожного агента, а перевірки змінюються з рекомендованих на обов’язкові зі зростанням ставок.
Спеціалізовані агенти замість монолітного інтелекту
«Навіть коли я працював у Google, я думав, що не вірю в AGI як такий собі єдиний і уніфікований тип моделі», – сказав Аматріен аудиторії. «Я вважаю, що набагато краще думати про це як про композицію, начебто мати спеціалізованих агентів, які дуже добре справляються з певним завданням, а потім складати систему з цих спеціалізованих агентів».
Архітектура Expedia починається на рівні компонентів. Інструменти складаються в навички, навички збираються в під-агентів, а під-агенти оркеструються в повну агентську систему. «Вам потрібно мати ці уніфіковані принципи, які говорять про такі речі, як тон, який ми використовуємо, як ми звертаємося до користувача, як ми передаємо контекст, пам’ять», – сказав він. «Все це потрібно ретельно розробити». Він представив це як проблему системного дизайну. «Це не про модель, це не про конкретне рішення, це про те, як ви проєктуєте систему».
Аматріен стверджував, що вузьке зонування кожного агента також полегшує безпеку системи, оскільки команди можуть оцінювати та блокувати окремих агентів ізольовано перед їх композицією.
Коли користувач мусить зробити останній клік
Ціни на подорожі змінюються в реальному часі, доступність рейсів змінюється щохвилини, а відгуки про готелі часто суперечать заявам постачальників. Аматріен описав систему, яка поєднує генерацію, доповнену пошуком (retrieval-augmented generation), з прямими викликами API, вибираючи підхід залежно від затримки. «Якщо користувач ставить вам питання, наприклад, скільки зазвичай коштує чотиризірковий готель у Чикаго в липні, ви не очікуєте, що агент відповідатиме дві хвилини», – сказав він. «Ви очікуєте негайної відповіді, тому що цю відповідь можна кешувати, і їй не потрібна інформація в реальному часі». Готель для сімей з дітьми, чотиризірковий біля озера Мічиган з басейном, може виправдати 30-секундне вікно обробки».
«Постачальник може сказати: «Так, у нас чудовий басейн», але потім у нас є відгуки мандрівників, і ми бачимо, що є два відгуки, які говорять, що басейн був не дуже хороший або не працював після 18:00», – пояснив Аматріен. Звичайний чат-бот, додав він, просто виводив би те, що постачальник заявляє сам, тоді як Expedia перехресно звіряє інформацію з власним корпусом відгуків.
«Ми не хочемо, щоб агент бронював готель або купував вам квиток на літак», – сказав Аматріен. «Це те, що користувач повинен мати можливість зробити сам. Агент може рекомендувати, пропонувати, обговорювати з вами, але ви повинні зробити цей клік. І це не підлягає обговоренню». Він стверджував, що це обмеження також є рішенням щодо безпеки. «Як тільки ви встановлюєте ці принципи дизайну, вам також не потрібні обмеження, тому що інакше вам доведеться встановлювати всі ці обмеження постфактум».
Наступні зловмисники будуть іншими системами ШІ
«Безпека повинна бути принципом, який максимально зміщується вліво (shifted as left as possible) і є частиною самого дизайну», – сказав Аматріен у відповідь на запитання аудиторії. «І зазвичай, коли вам потрібне обмеження, це тому, що ви не подумали про це заздалегідь».
Другий учасник аудиторії наполягав на уроках, винесених із продакшну. Аматріен описав петлю зворотного зв’язку, де сигнали моніторингу надходять назад до набору оцінок. «Ви можете майже повністю автоматизувати весь цикл», – сказав він. «Але мати весь цей цикл зворотного зв’язку від реальних сигналів, від вашої робочої системи ШІ, аж до звітування та якнайшвидшого виправлення стане надзвичайно важливим».
Контрольні точки Аматріена – це ставка на те, що управління, відкаліброване відповідно до ризику, може випереджати цю петлю зворотного зв’язку. Окреме червневе опитування Pulse від VentureBeat щодо безпеки агентів, проведене серед 107 підприємств, показує, наскільки тонкою є ця грань. Більше половини (54%) вже мали інцидент з безпекою агентів або ледь його уникнули. П’ятдесят дев’ять відсотків планують впровадити, додати або замінити інструменти безпеки агентів протягом 12 місяців, а 29% планують зробити це цього кварталу. Рівень інцидентів зростає зі збільшенням розміру організації, досягаючи 63% серед підприємств з понад 1000 співробітників порівняно з 49% для компаній зі 101-1000 співробітниками. І ізоляція в пісочниці (sandbox isolation), єдиний засіб контролю після збою, що обмежує збитки, зменшується з 35% впровадження в менших компаніях до лише 20% у найбільших.
Аматріен попередив, що загрози все частіше надходитимуть від інших систем ШІ. «Ви будете отримувати загрози не тільки від людей, але й від інших потужних зовнішніх агентських систем, які будуть перевіряти все, що ви робите. І як тільки ви щось виявите, важливим стає не тільки виявлення, але й швидкість виправлення».
Подробиці можна знайти на сайті: venturebeat.com
