Gemini Robotics 2 включає три моделі, але лише одна доступна для публічного використання.


Роботи, що працюють на базі моделей Gemini від Google, стали ще більш вправними. З появою Gemini Robotics 2 ці фізичні роботи можуть виконувати складніші завдання, безперервно аналізувати мінливе середовище та співпрацювати з іншими роботами. Це стало можливим завдяки трьом новим підмоделям, одна з яких вже доступна для розробників.
Відео з роботами, які бігають, танцюють і роблять сальто, вже давно є частиною інтернету, але ці машини були запрограмовані на виконання дуже вузькоспеціалізованих завдань. Мета Gemini Robotics — створити універсального робота, здатного робити все, що може людина. Науковці Google DeepMind іноді називають це «фізичним AGI» (штучним загальним інтелектом). По суті, ви говорите роботу, що робити, і він це робить. З випуском 2.0 Google стверджує, що їхній робототехнічний ШІ може керувати цілим гуманоїдним роботом з покращеною спритністю, навіть для машин зі складними людськими руками.
Все починається з Gemini Robotics ER 2 — оновленої моделі «втіленого міркування» (embodied reasoning), яка, за твердженнями DeepMind, є значним стрибком порівняно з попередньою версією 1.6. Вона інтегрована з Gemini Live API, надаючи розробникам можливість відчути цей передбачуваний стрибок уперед.
Gemini Robotics ER 2 є так званою моделлю зорового мовлення (VLM — vision-language model). Вона розроблена для розуміння інструкцій та світу навколо. Головне оновлення полягає в тому, що ER 2 може обробляти прямі відеопотоки з камер робота, дозволяючи системі відстежувати прогрес, коли робот робить крок за кроком. Google зазначає, що Gemini Robotics ER 2 класифікує повноту відеокадрів з точністю майже 60 відсотків. Це все ще далеко від досконалості, але значно краще, ніж у версії 1.6 або в конкурентних ШІ-моделях, що базуються на візуальному сприйнятті.
Gemini Robotics ER 2 краще розуміє світ, ніж інші моделі, але лише трохи. Джерело: GoogleПошук конкретних моментів у відеопотоках також є ключовим для правильного виконання завдання. Коли ви просите робота налити чашку кави, ви, безумовно, хочете, щоб він знав, коли припинити наливати. ER 2, очевидно, робить це набагато краще, ідентифікуючи ключові моменти з точністю майже 90 відсотків. Коли роботи виконують багатоетапні завдання, модель втіленого міркування дозволяє їм розуміти невдачі в режимі реального часу. Потім система може спробувати виконати цей окремий крок знову, замість того, щоб повертатися до початку. Наприклад, робот може просто скоригувати положення та рух руки, якщо м’яч, який він намагається підняти, відкотився, або якщо хтось пересунув контейнер.
Нова версія моделі втіленого міркування також забезпечує можливість співпраці між роботами, керованими оновленим ШІ Google DeepMind. Демонстраційні відео показують, як Apollo 2 від Apptronik та простіший Franka F3 Duo працюють разом над завданням, не заважаючи один одному. Хоча тестові роботи все ще не можуть зрівнятися зі швидкістю чи грацією людини, відео демонстрації містять багато реальних кадрів роботи роботів, і вони здаються набагато менш нерішучими, ніж у минулих тестах.
Розуміння — це лише перший крок; переміщення робота у фізичному світі — це сфера відповідальності іншої моделі. Після створення плану завдання модель зорового мовлення передає управління оновленій моделі зорового мовлення-дії (vision-language-action), відомій просто як Gemini Robotics 2. Ця ШІ-модель генерує дії робота на основі цих інструкцій так само, як інші генеративні системи створюють текст чи зображення. Також існує версія з низькою затримкою для офлайн-використання під назвою Gemini Robotics On-Device 2. Ці моделі наразі доступні лише обмеженій групі тестувальників.
Google стверджує, що нові моделі дій є набагато точнішими та ефективнішими. Навіть менша версія для роботи на пристрої може адаптуватися до нових дизайнів роботів лише за кілька годин даних про рух, або приблизно за 200 прикладів.
Уникнення «роботизованого апокаліпсису»
Проблеми з «галюцинаціями» ШІ добре відомі, але потенційна шкода від помилок, коли ШІ має фізичне втілення, що перебуває в просторі з людьми, може бути набагато більшою. З кожним випуском Gemini Robotics Google DeepMind наголошує, що серйозно ставиться до цього ризику. За даними DeepMind, кожен рівень Gemini Robotics включає «традиційні фізичні заходи безпеки з надійними фреймворками безпеки ШІ».
З випуском Gemini Robotics 2 з’явився новий стандарт безпеки під назвою ASIMOV-Agentic. Цей тест оцінює моделі за різними факторами безпеки. Він може визначити, чи відмовлятиметься агент втіленого міркування від небезпечних викликів інструментів від VLA (модель зорового мовлення-дії). Він також може визначити, чи можливо безпечно виконати завдання, а також чи здатна модель звернутися за допомогою до людини, якщо вона не впевнена щодо безпеки.
Google DeepMind зазначає, що Gemini Robotics ER 2 є найбезпечнішою моделлю команди на сьогодні, демонструючи надійну здатність розуміти безпеку та припиняти дії, коли людина знаходиться занадто близько до робота. Новий стандарт безпеки Google повністю доступний на Hugging Face.
Інформація підготовлена на основі матеріалів: arstechnica.com
