
Для компанії Waymo, яка розробляє автомобілі з автопілотом і входить до складу Alphabet (раніше Google), ставки у розгортанні штучного інтелекту (ШІ) надзвичайно високі. Її моделі не просто генерують текст чи автоматизують рутинні завдання: вони допомагають автомобілям орієнтуватися на непередбачуваних вулицях, реагувати на дії інших водіїв та приймати миттєві рішення у реальному світі.
Однак методи, які Waymo використовує для управління цими ризиками – безперервна оцінка, ретельно підібрані дані, людський нагляд та чітко визначені бізнес-результати – пропонують ширший план дій для підприємств, що впроваджують ШІ-агентів майже в будь-якій галузі.
Манасі Джоші, директорка з інженерії системного інтелекту та машинного навчання Waymo, на конференції VB Transform 2026 розповіла, як компанія з розробки автономних транспортних засобів тренує, тестує та розгортає ШІ у великих масштабах. На сьогодні Waymo подолала понад 220 мільйонів повністю автономних (або “тільки для пасажирів”) миль, при цьому кількість серйозних травм у ДТП на 17 разів менша, ніж у людей-водіїв на тій самій дистанції, згідно з даними компанії.
Щоб досягти таких вражаючих результатів, Джоші зазначила, що Waymo запровадила те, що вона назвала “розробкою, керованою оцінкою” або “орієнтованою на оцінку розробкою”, зробивши оцінку ключовою частиною інженерної роботи, а не остаточним кроком перед впровадженням.
«Стадія зрілості наших проєктів може бути легко визначена за зрілістю оцінок, які вони демонструють», – сказала Джоші.
На практиці Waymo частково оцінює готовність проєкту, аналізуючи зрілість тестів, що його оточують. Такий підхід має чіткі наслідки для підприємств, які створюють агентів для обслуговування клієнтів, помічників для написання коду, фінансових систем чи інших ШІ-застосунків: якщо компанія не може надійно виміряти продуктивність системи, вона, можливо, ще не готова до її впровадження в експлуатацію.
Оцінки мають тривати й після запуску
Джоші повідомила, що значна частина роботи Waymo над якістю змістилася в бік оцінок, включаючи тести, що проводяться під час навчання моделі, після навчання, а також у симуляціях з відкритим та закритим контуром.
«Оцінка – це не одноразове завдання для запуску моделі», – сказала вона.
Натомість Waymo розглядає оцінку як безперервний процес, що охоплює водіння, симуляцію та валідацію. Її методологія поєднує набори даних, метрики продуктивності та інфраструктуру, здатну ефективно працювати у великих масштабах.
Для підприємств це означає, що тестування агента перед запуском є недостатнім. Команди повинні продовжувати оцінювати його, оскільки змінюються базові моделі, бізнес-процеси, поведінка користувачів та вхідні дані. Ці оцінки також повинні бути пов’язані з реальними бізнес-результатами, а не спиратися виключно на загальні галузеві показники.
Джоші попередила, що вимірювання якості моделі настільки ж надійні, наскільки й дані для оцінки, що стоять за ними. Тому Waymo підтверджує свої заяви про продуктивність інформацією про властивості наборів даних, використаних для тестування її систем.
Тестування рідкісних і небезпечних випадків
Ієрархія оцінок Waymo залишається обґрунтованою однією головною метою: безпекою.
Компанія використовує власні журнали водіння, деякі сторонні дані та реалістичні симуляції, які піддають її системи впливу сценаріїв, що охоплюють мільярди синтетичних миль. Власники завдань обирають спеціалізовані дані та метрики для ситуацій, що включають вразливих учасників дорожнього руху, залізничні переїзди, будівельні зони та інші складні середовища.
Той самий принцип застосовується і поза автономним водінням. Підприємствам потрібно тестувати не лише рутинні запити, з якими їхні агенти успішно справляються, але й незвичайні ситуації, де помилки можуть призвести до фінансових, юридичних, безпекових чи репутаційних збитків.
Джоші наголосила, що Waymo не залишає рішення про випуск повністю автоматизованим системам. Її огляди готовності до виробництва включають ретельний людський нагляд, тоді як внутрішні керівники з питань безпеки затверджують випуск програмного забезпечення та розширення зон обслуговування.
«Це не керований ШІ, повністю автоматизований процес без людського нагляду», – сказала вона. «Йдеться про людські життя».
Ефективність не повинна йти на шкоду надійності
Waymo стикається з іншою проблемою, знайомою корпоративним ШІ-командам: попит на обчислювальні потужності, сховище, пам’ять та мережеві можливості зростає швидше, ніж доступні ресурси.
Компанія прагне до ефективності в усьому: від вилучення та зберігання даних, розподіленого навчання моделей, дистиляції моделей до симуляції та оцінки. Вона також робить акцент на «ефективності даних», обираючи найкорисніші приклади для навчання, а не вважаючи більший обсяг за замовчуванням кращим.
Waymo почала використовувати трансформери у 2017 році, а згодом розширила їх застосування на великі мовні моделі, моделі зору-мови та моделі зору-мови-дії. Джоші зазначила, що компанія зараз використовує генеративні мультимодальні моделі як частину своєї стратегії базових моделей.
Waymo розділяє свої технології між бортовими системами кожного автомобіля та зовнішньою інфраструктурою, що використовується для розробки моделей, обробки даних та симуляції. Така комбінація змушує компанію оптимізувати як інференс у реальному часі, так і більші системи, що його підтримують.
Агентам потрібні власні оцінки
Waymo також використовує ШІ-агентів внутрішньо як інструменти для підвищення продуктивності інженерів. Джоші зазначила, що агенти допомагають аналізувати розподіл даних, оцінювати ефективність даних та сортувати проблеми, виявлені в телеметрії автомобілів, навчальних прогонах та невдалих завданнях з оцінки.
Мета полягає в тому, щоб прискорити дослідницьку роботу, дозволивши інженерам приділяти більше часу судженням та вирішенню складних технічних проблем. Але Waymo також оцінює цих агентів, щоб гарантувати, що вони надають надійні, точні результати, а не відправляють співробітників непродуктивними шляхами.
Для керівників підприємств головний урок від Waymo полягає в тому, що агентний ШІ вимагає більше, ніж просто вибір потужної моделі. Організаціям потрібна чітко визначена мета, репрезентативні дані для оцінки, безперервне тестування, інфраструктура, що може ефективно працювати, та конкретні особи, відповідальні за прийняття рішень, які залишаються відповідальними за впровадження.
«Завоювання довіри є надзвичайно важливим», – сказала Джоші.
Подробиці можна знайти на сайті: venturebeat.com
