Підрозділ Alibaba Cloud розробив систему DualLane, яка аналізує запити клієнтів до служби технічної підтримки та в деяких випадках дозволяє не залучати великі мовні моделі (LLM) штучного інтелекту для вирішення певних проблем. Такий підхід дає змогу компанії діяти швидше, точніше та з меншими витратами.

Alibaba прагне не завжди доручати своїм співробітникам обробку запитів до служби підтримки, оскільки вони працюють повільно, а їхня праця коштує дорого. Проте, коли компанія спробувала масштабно залучити ШІ-агентів до обробки запитів, вона виявила, що вони можуть реагувати неналежним чином. Зазначаються три типи помилок: ШІ-агент не підключає потрібні інструменти; під час підключення інструментів не використовує всіх належних параметрів завдання; після виконання одного з кроків завдання не завжди належним чином витягує необхідні параметри з результатів роботи для передачі на наступний крок; нарешті, під час підготовки остаточної відповіді ШІ-агент може невірно інтерпретувати результати або пропустити ключову інформацію.
Рішенням проблеми стала система DualLane — обробка всіх запитів за моделями «швидкого» та «повільного» способів. Якщо запит відповідає відомій раніше стандартній проблемі, аналіз за «повільним» сценарієм відключається, і клієнту пропонується шаблонне вирішення проблеми. Коли відповідно до «повільного» сценарію виявляється низка схожих проблем, вони групуються в «кластер» і формується пропозиція перенести цей клас у «швидкий» спосіб — ухвалення такого рішення координує вже людина. Аналіз проблеми та її співвіднесення зі «швидким» способом вимагає невеликих витрат ШІ-токенів; із «повільним» — близько 3000 токенів, але й ця витрата компенсується вищою ефективністю.
DualLane, як показало тестування, перевершує за якістю інші засоби координації ШІ-моделей, такі як LLMCompiler і React: точність становила 96,5 % при мінімальній затримці, завдяки чому Alibaba Cloud інтегрувала DualLane в роботу.
За матеріалами: 3dnews.ru
