Наскільки ви готові довірити великій мовній моделі (LLM) контроль над вашим цифровим життям?
Щоб отримати максимальну користь від моделі, потрібно надати їй доступ до найважливішого. Для перфекціоністів або тих, хто вагається перед ШІ, це здається значним кроком. Але для Ендрю Амбросіно, провідного інженера OpenAI, який працює над настільною програмою компанії, це єдиний спосіб протестувати майбутнє. Саме тому ця програма тепер має доступ і контроль над його електронною поштою, акаунтом Slack, телефоном, такими додатками, як Notion і Figma, та багатьма іншими.
«Якщо я прошу його написати документ, чи є ймовірність, що він візьме інформацію з приватного повідомлення на цю тему і не усвідомить, що не повинен ділитися певними даними? Так», — сказав Амбросіно TechCrunch. «Я роблю це для роботи. Я готовий зазнавати особистих незручностей час від часу, якщо доведеться. І поки що мені не доводилося».
Амбросіно працює над найважливішим продуктом OpenAI — ChatGPT Work, який було випущено минулого місяця і доступний за найнижчим тарифним планом компанії за 20 доларів на місяць. Цей продукт призначений для того, щоб дозволити офісним працівникам використовувати ШІ-агентів, підключаючи LLM до цифрових робочих процесів, які використовують бухгалтери, інвестори, лікарі та всі інші, чий робочий день домінує комп’ютер.
Маркетингові матеріали OpenAI лаконічно визначають мету: світ, де «[штучний] інтелект виходить за межі відповідей на запитання, допомагаючи кожному втілити свої найбільші ідеї в реальність».
Для розробників програмного забезпечення ця зміна вже відбувається, але вона повільно поширюється на інші відділи. ChatGPT Work — це модифікована версія інструменту кодування Codex від компанії. Він призначений для того, щоб надати неінженерам версію тієї ж функціональності, яку програмні інженери вже отримують від агентів: інструмент ШІ, який не просто відповідає на запитання, а самостійно виконує багатоетапні проєкти.
«У цьому новому факторі ChatGPT може фактично виконувати для вас цілі, дуже складні завдання автономно, у спосіб, який є приємним і безпечним», — сказав TechCrunch Тібо Сотьйо, який керує основною продуктовою роботою OpenAI, включаючи Work. «Це місія OpenAI — залучити всіх».
З комерційної точки зору це має велике значення. Агенти, які працюють довше, споживають більше токенів, що робить їх більш прибутковими для OpenAI на одного користувача. Охоплення нових професій має вирішальне значення — не лише для OpenAI, а й для галузі загалом. Якщо кодування виявилося прибутковим напрямком для ШІ-лабораторій, це все ще незначна частина професійної роботи, яку ШІ-інструменти повинні забезпечити, щоб ці компанії могли виправдати свої величезні інвестиції в навчання та обчислення. Хоча лабораторії зосереджувалися на програмних інженерах, конкуренти, що працюють у конкретних галузях, як-от Harvey (для юриспруденції) та Clay (для продажів), залучали цих клієнтів, використовуючи модель-агностичний підхід, тобто вони підключатимуть будь-який ШІ, що найкраще працює на той момент.
Галузеві аналітики розглядають це як один із головних викликів для OpenAI та її конкурентів. «Якщо лабораторії не зможуть швидко отримати ключові доповнювальні активи, необхідні для масштабування ШІ на ринку, цінність буде накопичуватися в іншому місці», — написав Крістіан Каталані в блозі a16z «Час будувати».
Щоб ШІ-додатки працювали для людей, які не є розробниками програмного забезпечення, потрібна додаткова допомога. Неінженерний персонал OpenAI, як-от команди з комунікацій та фінансів, почав використовувати Codex «у той час, коли він був їм активно ворожий — запитував їх про код і показував їм: «о, у вас тут порожній див для цієї речі»», — сказав Амбросіно, посилаючись на технічний звіт щодо змін програмного забезпечення. «Тож ми почали робити його більш загальнопризначеним між лютим і зараз».
Дослідження, підтримане OpenAI, показало, що в червні 98% співробітників OpenAI використовували Codex, але лише 17% організаційних підписників і менше 1% індивідуальних підписників використовували агентурний інструмент кодування. Ця різниця між майже повним впровадженням всередині компанії та незначним впровадженням зовні є викликом та можливістю для компанії.
«Чим більше цінності та користі ми генеруємо для користувачів, тим більше вони будуть готові платити за частину цієї користі, і саме так ми завжди бачили ChatGPT», — сказав Сотьйо. «Ви сидите і думаєте: «Звісно, я хочу платити 20 доларів на місяць за це», тому що цінність, яку ви отримуєте, набагато більша».
Як зробити ШІ інтуїтивно зрозумілим
Щоб зрозуміти цей розрив, корисно зрозуміти, що будують інженери OpenAI. Кожна LLM потребує того, що інженери називають «обв’язкою» — програмне забезпечення, що оточує модель, яке визначає, яку інформацію вона бачить, які інструменти може використовувати та як надає вам відповіді.
Якщо ви хочете, щоб модель виконувала завдання — стала агентом — обв’язка надає їй інструменти та інструкції для використання їх у довгострокових завданнях. Для розробників інтерфейс командного рядка (CLI), який дозволяв LLM писати код, був достатнім, щоб змінити спосіб створення та розгортання програмного забезпечення. Але більшість людей не використовують CLI; є причина, чому Windows замінила DOS.
«Агентурний продукт, який виходить за рамки розробки програмного забезпечення, буде тим, що буде взаємодіяти з брудним світом вашого життя, ваших інструментів і вебсайтів, які були створені в 1995 році і ніколи не оновлювалися», — сказав Амбросіно TechCrunch, пояснюючи, що досвід, який створює його команда, життєво важливий для розширення доступу до корисного ШІ.
Розглянемо такі додатки, як Claude Code і Codex: вони вивільнили «вібраційне кодування», абстрагуючи все фактичне написання програмного забезпечення і дозволяючи користувачам просто повідомляти моделі, що вони хочуть від програми. Тепер OpenAI хоче зробити функціональність, знайдену в таких інструментах, як OpenClaw, які кодери використовують для роботи з LLM, такою ж простою, як запит.
«Без цих продуктів перед моделлю експерти знали б, як отримати ті самі результати, але ви б не отримали мільярд людей, які використовують цю річ», — сказав Амбросіно. Цей компроміс між тим, що потрібно досвідченим користувачам, і тим, що вимагає масове впровадження, проявляється у внутрішніх дебатах в OpenAI, де деякі співробітники стверджують, що кнопка є непотрібною, якщо користувачі можуть просто запитати модель безпосередньо.
«Ми відступаємо від цього — тому що це дуже рано», — сказав Амбросіно. «Виявлюваність має значення на цьому етапі, і в певний момент ми не матимемо кнопки».
Work має ще кілька кнопок для вибору проєктів та плагінів, але прагне до того самого інтерфейсу «чарівної скриньки», що й інші продукти OpenAI. Він порівнює це зі скевоморфізмом, зникаючою практикою створення цифрових інструментів, які виглядають як фізичні об’єкти, які вони замінили, наприклад, додаток-калькулятор, зроблений схожим на кишеньковий калькулятор. «Ці речі були не просто недолугим дизайном. Це насправді допомогло людям увійти в це [і] зробити перехід», — сказав Амбросіно.
OpenAI не повідомила, скільки людей використовують Work порівняно з Codex, але спільний додаток використовують лише 20 мільйонів людей, порівняно з понад мільярдом користувачів, які, за словами компанії, надсилають запити до ChatGPT онлайн.
Надання ChatGPT ліцензії на навички
Наразі OpenAI пропонує цей інструмент як найкращий для рутинних, інтенсивних даних завдань координації. Її співробітники, наприклад, налаштовують щотижневі звіти про показники та перетворюють електронні таблиці на інструменти планування.
Я спілкувався з венчурними інвесторами, які використовують агентів для збору відповідної інформації та аналізу компаній у меморандуми про інвестиції, а також з операційними командами, які створюють власні панелі інструментів та візуалізації даних. Сем Альтман використовує його для планування своїх відпусток. Один інженер OpenAI описав, як попросив програму переглянути розмову в Slack щодо інженерної проблеми та «створити деякі діаграми», а потім отримав серію проникливих графіків.
«Для середнього працівника або співробітника будь-якої з цих компаній, включно зі мною, існує справжній потік інформації», — сказав Акшай Натан, керівник команди інженерів продукту в OpenAI. «Наші можливості обробляти все, що нам доступно, а потім діяти відповідно, насправді обмежені. Ця інформація зберігається в усіх цих системних інструментах запису [наприклад, Salesforce]… цінність ChatGPT полягає в тому, що ви вже маєте доступ до цього, але тепер ви дійсно маєте до нього доступ».
Таким чином, це може стати цифровим персональним помічником, про який мріють євангелісти ШІ. Як і у випадку з Claude Cowork або Perplexity AI browsing agent, ChatGPT Work пов’язує агентів з вашим існуючим робочим простором — електронною поштою, веб-браузером, низкою SaaS-платформ — і використовує цей контекст для вас.
Коли система працює, вона може вражати: я попросив ChatGPT Work витягнути дивно відформатований календар дитячого садка мого сина з моєї електронної пошти та перенести його до мого Google Календаря, і він це зробив, заощадивши мені багато повторного введення даних. Сподіваюся, тепер я не забуду шкільний пікнік або не пропущу можливість організувати відпустку для догляду за дітьми.
Я не довіряв OpenAI доступ до моєї скриньки, вихідних інтерв’ю чи чернеток історій (не хвилюйтеся, ненависники ШІ) і не дозволив би йому мати доступ до мого банківського рахунку, але я вірю, що це було б корисніше, якби я мав віру. Я доручив йому провести фінансовий аналіз публічних компаній, які я висвітлюю, і він надав мені панель показників, що автоматично оновлюється; він створив базу даних космічних запусків, яку можна запитувати, завдання, яке раніше мені доводилося виконувати, написавши скрипти Python. Він також надсилає мені щотижневий електронний лист про нові дослідження ШІ, опубліковані в академічних репозиторіях. Я продовжу експериментувати з ним.
Хоча запитувати модель про щось інтуїтивно зрозуміло, надати їй те, що їй потрібно для дій, не так просто. Налаштування дозволів для агентів на доступ, скажімо, до хмарного сховища було заплутаним і замкненим — я кілька разів намагався надати йому лише доступ «лише для читання» і отримував повідомлення про помилку. Сама модель не була надто корисною, але врешті-решт у мобільному додатку з’явилося діалогове вікно, яке повідомило мені, що лише повний доступ дозволить їй працювати.
Багато важливих налаштувань доступні лише у веб-додатку, тому я часто працював в обох одночасно. Іноді обмеження ChatGPT Work спантеличують — підключіть його до свого Google Календаря, і він зможе створювати події, але не нові календарі. І не турбуйтеся нічим займатися, якщо рівень зусиль невеликий, інакше ви отримаєте найгіршого стажера, з яким ви коли-небудь працювали.
Це поширена порада від ранніх прихильників ШІ, які побоюються, що розчаровані новачки здадуться. Джо Гершенсон, керівник інженерної групи OpenAI, визнав, що налаштування зусиль ще не є інтуїтивно зрозумілими для нових користувачів — «є речі, які ми можемо зробити краще, щоб допомогти їм отримати правильний рівень міркувань…», — сказав він, додавши: «Слідкуйте за цим простором».
OpenAI стикається з ще одним важливим викликом при виході на ринок звичайних офісних працівників: більшість робочих процесів не такі вимірювані або оцінювані, як код. Програмне забезпечення або працює, або ні, і навіть це розрізнення зменшує нюанси щодо того, що робить код хорошим чи поганим. Хороша презентація, бізнес-стратегія чи торговий промоушн не так легко оцінити чи відстежити.
«Одним з унікальних викликів продукту, подібного до цього, є те, що він дійсно може робити будь-що», — сказав Амбросіно. Коли я запитав, навколо яких конкретних проблем команда розробляє дизайн та на які робочі процеси вони орієнтуються, інженери, з якими я розмовляв, ухилилися, сказавши, що це питання до дослідницької команди OpenAI.
OpenAI пізніше надала відповідь, повідомивши TechCrunch, що вона використовує свій бенчмарк GDPval, отриманий з 44 професій та сотень тестів з роботи з знаннями, і доповнює його відгуками користувачів. Менш офіційна відповідь полягає в тому, що він походить від самих співробітників OpenAI. Амбросіно сказав: «Нам завжди доводиться розбиратися… чи ми робимо робочий процес, який буде робити кожен, чи ми дивні?»
Ранні прихильники самого додатку створять цінний слід своєю реальною діяльністю — значна частина успіху інструментів кодування побудована на подібному зборі даних — за умови, що вони не відмовляться від його використання для навчання. (Я відмовився).
Суперництво, яке зумовило дизайн продукту OpenAI
Незважаючи на всю увагу до інтерфейсу моделі, інженери OpenAI неохоче відповідали на досить просте запитання: чим Codex та ChatGPT Work відрізняються від Claude Cowork або інших конкуруючих агентурних оболонок, призначених для масової бази користувачів?
«Це буде дуже розчаровуюча відповідь для вас, і мені шкода, але чесна відповідь полягає в тому, що я дійсно не дивлюся на оболонки, які вони створюють», — сказав Гершенсон у типовій відповіді. «Виникає мем із «Божевільних» «Я взагалі про вас не думаю».
Чесно кажучи, я їм не вірю, хоча б через надзвичайну схожість користувацьких інтерфейсів продуктів, потребу в конкурентній розвідці в будь-якому бізнесі, і тому, що перше, що ChatGPT Work попросив мене зробити, коли я почав його використовувати, це перенести мої дані Claude Cowork.
Зрозуміло, якщо Claude Code є чутливою темою в офісах OpenAI. Їхній корпоративний конкурент визначив ринок ШІ-кодування та розпочав революцію в тому, як програмні інженери виконують свою роботу. Це додатково дратує, тому що OpenAI мала ідею першою, але не зовсім правильно її реалізувала.
Коли OpenAI вперше розробила Codex як веб-додаток, інженери трохи «забігли вперед» — або, як каже Амбросіно, «трохи більше AGI-pilled». Коротше кажучи, вони поставили на те, що модель буде достатньо розумною, щоб самостійно впоратися із завданням з мінімальним втручанням користувача.
Створений незабаром після цього, Claude Code був орієнтований на діалог з користувачем. Якщо ви давали йому проблему, він досліджував можливості та пропонував три-чотири варіанти для продовження. Як тільки ви обирали, він робив невеликий крок вперед, а потім знову перевіряв, надаючи постійні оновлення та залишаючи менше простору для помилок моделі та оболонки.
«Наш продукт був трохи попереду того, де була модель і оболонка на той час», — говорить зараз Амбросіно.
OpenAI зрештою послідувала цьому прикладу, додавши більше можливостей для користувачів взаємодіяти з моделлю. Це стало Codex, який ми знаємо сьогодні, з настільними та мобільними додатками. Використовуючи статистику завантажень як показник інтересу до програм, Claude Code був більш затребуваним до квітня цього року, але тепер Codex трохи випереджає; опитування корпоративного використання також свідчать про те, що OpenAI наздоганяє.
Частково цей успіх полягає в правильному позиціонуванні продукту на ринку, а частково — в скаргах на обмеження безпеки моделей Anthropic та нестачу обчислювальних ресурсів. Кроки OpenAI до більш людиноцентричної оболонки тривають з ChatGPT Work, але інженери, з якими я розмовляв, наполягали, що ключовою відмінністю є потужність новітніх, потужних та економічно ефективних моделей OpenAI.
«Розчаровуюча відповідь полягає в тому, що часто це модель, і одне, що ми намагалися добре зробити з цим додатком, — це повністю використати модель», — сказав Амбросіно.
Що робить оболонку хорошою, зрештою?
Це пояснення повертає до «гіркого уроку», вивченого дослідниками ШІ, що краща загальна модель важливіша за специфічний досвід роботи в певній галузі. Для справжніх віруючих оболонка — це тимчасова опора, а не захист.
«Ви могли б отримати хороші результати в короткостроковій перспективі, додавши купу доповнень — якщо, то та інструменти — але, ну ж бо, наступна модель вийде через кілька місяців і зробить це застарілим», — сказав Гершенсон TechCrunch. Його команда зосереджується на найпростіших способах надати моделі доступ до інструментів та контексту, які їй потрібні — і не більше.
«Мета хорошого інженерного проектування оболонки —… бути більш точним щодо того, яка інформація справді потрібна моделі для вирішення вашої проблеми, тому що моделі стають все кращими і кращими в цьому, якщо ви просто дозволите їм робити свою справу», — сказав Гершенсон.
Проте залишається відкритим питання, чи готові до цього більшість людей або моделей. Ітан Молік, професор Уортонської школи бізнесу, який вивчає інструменти ШІ на робочому місці, все ще вважає Claude більш зручним для користувача, пишучи, що «ChatGPT має тенденцію хотіти робити магію та просто робити це за вас, тоді як Claude робить порівняння та показує їх, неодноразово запитуючи вхідні дані та відгуки, і роблячи тести A та B».
Сотьйо, і, можливо, OpenAI загалом, не погоджуються, стверджуючи, що розмовний характер додатка кращий, ніж навчання користуванню програмою. «Ми точно бачимо, що світ, здається, готовий», — каже він про додаток. «Ось чому ми маємо неймовірне впровадження».
Однак незрозуміло, чи є модель-специфічна оболонка правильним вибором для максимізації моделі. Порівняння, проведені такими компаніями, як Composio та Databricks, показують, що різні комбінації оболонки та моделі дають різні результати на бенчмарках кодування. Databricks виявила, що Pi, відкрита оболонка, опублікована компанією Earendil, перевершила Codex, використовуючи ту саму модель GPT 5.5. Pi використовувалася для створення таких проєктів, як OpenClaw та Cloudflare OS.
Автор Pi, Маріо Зекнер, каже, що його навмисно мінімалістична оболонка є доказом того, що підхід AGI-pilled може працювати, принаймні для розробників програмного забезпечення та завдань кодування. Він каже, що те, чого не вистачає в явних функціях, компенсується його здатністю модифікувати себе та створювати власні інтерфейси. Він співчуває виклику, з яким стикаються інженери OpenAI, розширюючи свою базу користувачів за межі інженерів.
«Все має форму кодуючого агента… причина в тому, що вони мають лише дані для навчання завдань кодуючого агента», — сказав він TechCrunch. «Скажімо, я менеджер, я приймаю рішення сьогодні, а результат настає через кілька місяців. Ви не можете зафіксувати це в простому відстеженні взаємодії користувача та агента, тому всі ці типи завдань і все, що ви не оцифровуєте, є недоступним для вивчення моделлю».
Як і інші постачальники відкритого програмного забезпечення, він розглядає зусилля великих лабораторій щодо просування своїх оболонок як спосіб прив’язати користувачів; «Їм потрібно володіти всім стеком, інакше вони стануть просто постачальником моделей, а потім їм доведеться конкурувати з китайськими моделями».
Він та інші інженери, з якими спілкувався TechCrunch, вважали, що уявлення про витрати на токени та поведінку агентів в оболонках передових лабораторій надто обмежене. У певному сенсі це менш важливо для нетехнічних працівників, але, як і з інструментами кодування, впровадження в масштабах, на які сподівається OpenAI, врешті-решт змусить до більш складних розмов про витрати.
Наприклад, експериментуючи з підпискою за 20 доларів на місяць, я використав понад 80 мільйонів токенів за чотири дні, що коштувало 65 доларів, згідно з аналізом моделі (в додатку немає панелі інструментів). Це субсидія більш ніж у 3 рази перевищує ціну підписки лише за чотири дні неформального використання.
«Ми щодня працюємо над розширенням меж ефективності», — сказав Сотьйо, посилаючись на нещодавнє зниження ціни на 80% для користувачів моделі Luna від OpenAI. «Якщо ви прокинетеся через шість місяців, ви повинні мати можливість виконувати всі ті самі [завдання] з меншими витратами».
Інше актуальне питання полягає в тому, чи створюють ці додатки ефект прив’язки клієнтів через збереження даних, або просто через складність налаштування доступу до всіх плагінів та їхніх дозволів.
Всередині штаб-квартири OpenAI з дерев’яними панелями та рослинами, яку я відвідав у липні, атмосфера була спокійною, але трохи напруженою; ці люди мали багато роботи. Інженери, з якими я розмовляв, постійно стежили за своїми ноутбуками під час розмови та поспішали з однієї переговорної кімнати до іншої.
Натан, керівник команди інженерів продукту, сказав, що фокус залишається на «обіцянці чарівної скриньки, але я все ще думаю, що є занадто багато складності… Я дуже оптимістично налаштований, що ми зможемо вирішити це, за допомогою моделі та в справді нативному для ШІ способі».
Коли ви купуєте за посиланнями в наших статтях, ми можемо отримати невелику комісію. Це не впливає на нашу редакційну незалежність.
За даними порталу: techcrunch.com
