
Тренування моделей ШІ за допомогою інших моделей ШІ стало популярною метою для компаній, що займаються розробкою штучного інтелекту, і дослідник із програми стипендіатів Anthropic представив ранній погляд на те, як це може виглядати на практиці.
У п’ятницю Anthropic опублікувала нову статтю під назвою “Automated Researchers Can Reliably Mitigate Alignment Failures” (“Автоматизовані дослідники можуть надійно усувати збої узгодженості”). У ній детально описано, як системи ШІ можуть надійно покращувати продуктивність моделі за певними показниками узгодженості. Отримавши 10 тестів на специфічну невідповідну поведінку, автоматизовані системи змогли покращити продуктивність за кожним із них, не погіршуючи загальної продуктивності.
Система, розроблена під керівництвом стипендіата Anthropic Чен Юе-Ханя, відтворює значну частину традиційного підходу до досліджень. Кожна автоматизована система аналізує доступну літературу, пропонує метод і тренує модель за цим методом протягом 30 хвилин, поступово збільшуючи складність тесту протягом кількох ітерацій. Ефективні методи зберігаються, а неефективні відкидаються, що дозволяє системі працювати швидко та в масштабі.
«Загалом, ці результати надають ранні докази того, що автоматизоване узгодження після тренування може стати практичним у найближчому майбутньому», — йдеться в статті.
Ця робота є кроком до рекурсивного самовдосконалення, яке багато хто вважає наступним значним кроком у прогресі ШІ. Якщо моделі зможуть самостійно покращувати своє тренування на узгодженість, цілком імовірно, що вони зможуть покращити й загальні методи тренування, що може призвести до того, що дослідники ШІ-людей невдовзі стануть застарілими.
У статті відкрито розглядається ця ідея, зокрема, проводиться порівняння автоматизованого дослідника узгодженості (AAR) з його людським аналогом. «Найкращий метод AAR перевершує те, що пропонують досвідчені люди, в середньому протягом шести годин», — зазначено в статті. «Напрямки досліджень, керовані людьми, не призводять до сильнішої продуктивності».
Наведено навіть порівняння витрат, на випадок, якщо хтось ще не переконався. «AAR коштує приблизно 4 долари на годину за API-інференс, тоді як ми платимо нашим дослідникам-людям 150 доларів на годину».
Справедливості заради, у статті також вказуються деякі обмеження такого підходу. Автоматизована система працює лише настільки ефективно, наскільки тести відображають реальні цілі узгодженості, і навіть тоді значна робота потрібна для встановлення та підтримки цих тестів — не кажучи вже про підтримку та розширення літератури, з якої черпають інформацію автоматизовані дослідники.
За даними порталу: techcrunch.com
