OpenAI створює агентів штучного інтелекту вже для будь-чого
OpenAI створює агентів штучного інтелекту вже для будь-чого

OpenAI створює агентів штучного інтелекту вже для будь-чого

Який контроль ви готові надати магістра права (LLM) над своїм цифровим життям? 

Отримати максимальну цінність від моделі означає дати їй ключі до контролю. Для тих, хто полюбляє контролювати або вагається використовувати штучний інтелект, це здається забагато. Для Ендрю Амброзіно, провідного інженера десктопного додатку OpenAI, це єдиний спосіб перевірити майбутнє, тому цей додаток тепер має доступ і контроль над його поштовою скринькою, його обліковим записом Slack, його телефоном, такими додатками, як Notion та Figma, тощо.

«Якщо я прошу його написати документ, чи є ймовірність, що воно візьме інформацію з приватного повідомлення на цю тему, не знаючи, що не повинно ділитися деякою інформацією? Так», – сказав Амброзіно TechCrunch. «Я зроблю це заради роботи. Я візьму на себе особисті удари час від часу, якщо доведеться. А мені цього не доводилося робити».

Амброзіно працює над найбільшим проєктом OpenAI, ChatGPT Work, який був випущений минулого місяця та доступний за найнижчим рівнем підписки компанії за 20 доларів на місяць. Продукт призначений для того, щоб дозволити офіційним працівникам запускати агентів ШІ, підключаючи LLM до цифрових робочих процесів, що використовуються бухгалтерами, інвесторами, лікарями та всіма іншими, чиє повсякденне життя зосереджено переважно на комп’ютері. 

У маркетинговому тексті OpenAI мету сформульовано лаконічно: світ, де «[штучний] інтелект виходить за рамки відповідей на запитання та допомагає кожному втілити свої найзаповітніші ідеї в реальність».

Для розробників програмного забезпечення цей зсув вже відбувається, але він повільно поширюється на інші відділи. ChatGPT Work — це модифікована версія інструменту кодування Codex від компанії. Він покликаний надати неінженерам версію тієї ж функціональності, яку розробники програмного забезпечення вже отримують від агентів: інструмент штучного інтелекту, який не просто відповідає на запитання, а самостійно виконує багатоетапні проекти.

«У цьому новому факторі ChatGPT може насправді виконувати цілі, дуже складні завдання для вас усіх автономно, у приємний та безпечний спосіб», – сказав TechCrunch Тібо Соттьо, який керує основною розробкою продуктів OpenAI, включаючи Work. «Це сама місія OpenAI — об’єднати всіх».

З комерційної точки зору це має велике значення. Агенти, які працюють довше, спалюють більше токенів, що робить їх більш прибутковими для OpenAI на одного користувача. Охоплення нових професій має вирішальне значення — не лише для OpenAI, а й для всієї галузі. Якщо кодування виявилося прибутковою територією для лабораторій штучного інтелекту, воно все ще є крихітною частиною професійної роботи, яку інструменти штучного інтелекту повинні забезпечити, якщо ці компанії хочуть виправдати свої величезні інвестиції в навчання та обчислення. Хоча лабораторії зосереджувалися на інженерах-програмістах, конкуренти, що спеціалізуються на конкретних вертикалях, такі як Харві (у сфері права) та Клей (у сфері продажів), переслідували цих клієнтів, використовуючи модельно-агностичний підхід, тобто вони підключатимуть той ШІ, який найкраще працює на даний момент.

Галузеві аналітики вважають це одним із головних викликів, з якими стикаються OpenAI та його конкуренти. «Якщо лабораторії не зможуть швидко отримати ключові додаткові активи, необхідні для масштабування ШІ на ринку, цінність накопичуватиметься в іншому місці», – написав Крістіан Каталіні в блозі a16z «Час будувати». 

Щоб застосунки штучного інтелекту працювали для людей, які не є розробниками програмного забезпечення, потрібна більша підтримка. Неінженерна робоча сила OpenAI, така як команди комунікацій та фінансів, почала використовувати Codex «в той час, коли він був налаштований до них вороже — запитував їх про код і показував: «О, у вас є порожня сторінка для цієї штуки», — сказав Амброзіно, маючи на увазі технічний звіт, призначений для змін у програмному забезпеченні. «Тож ми почали робити його більш універсальним з лютого по теперішній час».

OpenAI створює агентів штучного інтелекту вже для будь-чого - Фото 1
Діаграма, що показує використання Codex серед передплатників OpenAI, з статті «Перехід до агентного ШІ: докази Codex».Автори зображень: Джонстон та ін.

Дослідження, проведене за підтримки OpenAI, показало, що в червні 98% співробітників OpenAI використовували Codex, але лише 17% організаційних передплатників та менше 1% індивідуальних передплатників використовували цей інструмент агентного кодування. Ця різниця між майже повним впровадженням всередині компанії та незначним впровадженням за її межами є одночасно викликом і можливістю для компанії.

«Чим більше цінності та корисності ми створюємо для користувачів, тим більше вони будуть готові платити за певну частину цієї корисності, і саме так ми завжди сприймали ChatGPT», – сказав Соттьо. «Ви сидите і думаєте: «Звичайно, я хочу платити за це 20 доларів на місяць», тому що цінність, яку ви отримуєте, набагато більша».

Як зробити штучний інтелект інтуїтивно зрозумілим 

Щоб зрозуміти цей розрив, корисно зрозуміти, що створюють інженери OpenAI. Кожна LLM-програма вимагає того, що інженери називають «обладнанням» — програмного забезпечення, обгорнутого навколо моделі, яка вирішує, яку інформацію вона бачить, які інструменти вона може використовувати та як вона представляє вам свої відповіді. 

Якщо ви хочете, щоб ця модель щось виконувала — щоб вона стала агентом — harness надає їй інструменти та інструкції для їх використання в довгострокових завданнях. Для розробників інтерфейсу командного рядка (CLI), який дозволяв LLM писати код, було достатньо, щоб змінити спосіб створення та розгортання програмного забезпечення. Але більшість людей не використовують CLI; є причина, чому Windows замінила DOS. 

Агентський продукт, який виходить за рамки програмної інженерії, «буде чимось, що грається з безладним світом вашого життя, вашими інструментами та вебсайтами, які були створені в 1995 році та ніколи не оновлювалися», – сказав Амброзіно TechCrunch, пояснюючи, що досвід, який створює його команда, життєво важливий для розширення доступу до корисного штучного інтелекту.

Розглянемо такі програми, як Claude Code та Codex: вони розкрили шлях до «вібраційного кодування», абстрагувавши від усього фактичного написання програмного забезпечення та дозволивши користувачам просто вказати моделі, чого вони хочуть від програми. Тепер OpenAI хоче зробити функціональність, що знаходиться в таких інструментах, як OpenClaw, які кодери використовують для роботи LLM, такою ж простою, як підказки. 

«Без цих продуктів перед моделлю експерти знали б, як отримати ті самі результати, але ви б не досягли мільярда людей, які користуються цією річчю», – сказав Амброзіно. Цей компроміс між тим, що потрібно досвідченим користувачам, і тим, що вимагає масове впровадження, проявляється у внутрішніх дебатах OpenAI, де деякі співробітники стверджують, що кнопка не потрібна, якщо користувачі можуть просто запитати модель безпосередньо.

«Ми ухиляємося від [цього], бо це ще дуже рано», – сказав Амброзіно. «На цьому етапі важлива можливість виявлення, і в якийсь момент у нас не буде цієї кнопки». 

У Work є кілька додаткових кнопок для вибору проектів та плагінів, але він прагне створити той самий інтерфейс «магічної коробки», що й інші продукти OpenAI. Він порівнює це зі скевоморфізмом – практикою, що згасає, коли цифрові інструменти виглядають як фізичні об’єкти, які вони замінили, як-от додаток-калькулятор, зроблений під вигляд кишенькового калькулятора. «Це не було просто неприємним дизайном. Це насправді допомогло людям зацікавитися цим [і] здійснити перехід», – сказав Амброзіно.

OpenAI не повідомив, скільки людей використовували Work порівняно з Codex, але спільним додатком користуються лише 20 мільйонів людей, порівняно з понад мільярдом користувачів, які, за словами компанії, використовують ChatGPT онлайн. 

Надання ChatGPT ліцензії на майстерність

Наразі OpenAI позиціонує цей інструмент як найкраще підходящий для рутинних завдань координації, що потребують багато даних. Наприклад, його співробітники налаштовують щотижневі звіти про показники та перетворюють електронні таблиці на інструменти планування .

Я спілкувався з венчурними капіталістами, які використовували агентів для збору відповідних повідомлень та аналітики про компанії в інвестиційні меморандуми, а операційні команди розробляли спеціальні інформаційні панелі та візуалізації даних. Сем Альтман використовує це для планування своїх відпусток . Один інженер OpenAI описав, як просив програму переглянути розмову в Slack про інженерну проблему та «створити кілька діаграм», а потім отримував у відповідь серію змістовних графіків.

«Пересічний працівник чи співробітник будь-якої з цих компаній, включаючи мене, отримує величезний потік інформації», – сказав Акшай Натан, який очолює команду розробників продуктів в OpenAI. «Насправді ми досить обмежені в наших можливостях аналізувати все, що нам доступно, а потім вживати заходів. Ця інформація зберігається в усіх цих інструментах системних записів [таких як Salesforce]… цінність ChatGPT полягає в тому, що у вас вже є до неї доступ, але тепер у вас є до неї справжній доступ».

Отже, це може бути цифровий персональний помічник, про який мріють прихильники штучного інтелекту. Як і у випадку з Claude Cowork або Perplexity AI browser agent, ChatGPT Work пов’язує агентів з вашим існуючим робочим простором — електронною поштою, веб-браузером, низкою SaaS-платформ — і використовує цей контекст для роботи на вас.

Коли система працює, вона може бути вражаючою: я попросила ChatGPT Work вилучити дивно відформатований календар дошкільної освіти мого сина з моєї електронної пошти та додати його до мого Календаря Google, і це сталося, позбавивши мене багатьох повторюваних введень даних. Сподіваюся, тепер я не забуду про шкільну вечерю та не забуду організувати догляд за дітьми під час канікул.

Я не довіряв OpenAI доступ до моєї поштової скриньки, інтерв'ю зі джерелами чи чернеток історій (не бійтеся, ненависники ШІ) і не давав йому доступу до мого банківського рахунку, але вважаю, що він був би кориснішим, якби мав віру. Я доручив йому провести фінансовий аналіз публічних компаній, про які я пишу, і він надав мені автоматично оновлювану панель показників; він створив базу даних космічних запусків із можливістю запитів, завдання, яке мені раніше доводилося виконувати, пишучи скрипти на Python. Він також щотижня надсилає мені електронний лист про нові дослідження ШІ, опубліковані в академічних інформаційних центрах. Я продовжуватиму експериментувати з ним.

Хоча запитувати щось у моделі інтуїтивно зрозуміло, надання їй того, що потрібно для виконання дії, не так просто. Налаштування дозволів для агентів на доступ, скажімо, до хмарного диска було заплутаним і циклічним — я кілька разів намагався надати йому лише доступ для «читання» та отримував повідомлення про помилки. Сама модель була не дуже корисною, але зрештою в мобільному додатку з’явилося діалогове вікно, яке повідомляло мені, що лише повний доступ зробить її працювати. 

Багато важливих налаштувань доступні лише у веб-додатку, тому мені часто доводилося працювати в обох одночасно. Іноді обмеження ChatGPT Work бентежать — підключіть його до свого календаря Google, і він зможе створювати події, але не нові календарі. І не намагайтеся нічого робити, якщо рівень зусиль не високий, інакше у вас буде найгірший стажер, з яким ви коли-небудь працювали.

Це поширена порада від перших користувачів ШІ, які бояться, що розчаровані новачки здадуться. Джо Гершенсон, головний інженер OpenAI, визнав, що налаштування зусиль ще не інтуїтивно зрозумілі для нових користувачів — «є речі, які ми можемо зробити краще, щоб допомогти їм досягти правильного рівня міркування…», — сказав він, додавши: «Слідкуйте за цим простором».

OpenAI стикається з ще одним важливим викликом, проникаючи в звичайну роботу «білих комірців»: більшість робочих процесів не так вимірювані — або оцінювані — як код. Програмне забезпечення або працює, або ні, і навіть ця різниця зменшує нюанси щодо того, що робить код хорошим чи поганим. Гарну презентацію, бізнес-стратегію чи торгову пропозицію не так легко оцінити чи відстежити. 

«Одна з унікальних проблем такого продукту полягає в тому, що він може робити все, що завгодно», – сказав Амброзіно. Коли я запитав, які саме проблеми команда розробляє та на які робочі процеси вона орієнтована, інженери, з якими я розмовляв, заперечили, сказавши, що це питання до дослідницької групи OpenAI. 

Пізніше OpenAI надала відповідь, повідомивши TechCrunch, що використовує свій бенчмарк GDPval , складений з 44 професій та сотень тестів на знання, і доповнює його відгуками користувачів. Менш офіційна відповідь полягає в тому, що вона надходить від самих співробітників OpenAI. Амброзіно сказав: «Ми завжди повинні аналізувати… чи виконуємо ми той самий робочий процес, який виконуватимуть усі інші, чи ми дивні?» 

Ті, хто першими використовує сам застосунок, створять цінні сліди його фактичного використання — значна частина успіху інструментів кодування побудована на подібному зборі даних — за умови, що вони не відмовляться від надання його для навчання (я так і зробив). 

Суперництво, яке стимулювало розробку продуктів OpenAI

Незважаючи на всю увагу до інтерфейсу моделі, інженери OpenAI неохоче відповідали на досить просте запитання: що відрізняє Codex та ChatGPT Work від Claude Cowork або інших конкуруючих агентних систем, призначених для масової бази користувачів?

«Це буде справді розчаровуюча відповідь для вас, і мені дуже шкода, але чесна відповідь полягає в тому, що я насправді не дивлюся на системи, які вони створюють», – сказав Гершенсон у типовій відповіді. « Тут спадає на думку мем «Я зовсім про тебе не думаю» з Mad Men ».

Чесно кажучи, я їм не вірю, хоча б через надзвичайну схожість між інтерфейсами користувачів продуктів, необхідність конкурентної розвідки в будь-якому бізнесі, і тому що перше, що ChatGPT Work попросив мене зробити, коли я його запускав, це перенести мої дані Claude Cowork. 

Зрозуміло, що питання Клода Кода є делікатною темою в офісах OpenAI. Їхній корпоративний конкурент визначив ринок кодування штучного інтелекту та започаткував революцію в тому, як розробники програмного забезпечення виконують свою роботу. Це також дратує, оскільки OpenAI першим придумав цю ідею, але не зовсім правильно її використав. 

Коли OpenAI вперше розробив Codex як веб-додаток, інженери трохи перестаралися — або, як висловився Амброзіно, «трохи більше насичені штучним інтелектом». Коротше кажучи, вони зробили ставку на те, що модель буде достатньо розумною, щоб повністю самостійно виконувати завдання, з мінімальним втручанням користувача.

Створений невдовзі після цього, Claude Code був орієнтований на постійне спілкування з користувачем. Якщо ви ставили йому задачу, він розглядав можливості та пропонував три-чотири варіанти подальших дій. Після того, як ви робили вибір, він йшов трохи далі, а потім знову перевіряв, надаючи постійні оновлення та залишаючи менше місця для помилок моделі та систем.

Підхід Anthropic виявився ефективнішим, навіть якщо він вимагав більше роботи від користувачів. «[Наш] продукт трохи випереджав модель та ремені безпеки на той час», — каже зараз Амброзіно. 

Зрештою, OpenAI наслідував цей приклад, додавши більше можливостей для взаємодії користувачів з моделлю. Це стало тим Codex, який ми знаємо сьогодні, з настільними та мобільними додатками. Використовуючи статистику завантажень як показник інтересу до програм, Claude Code був більш затребуваним до квітня цього року, але тепер Codex трохи вирвався вперед; опитування щодо використання в підприємствах також свідчать про те, що OpenAI наздоганяє його.

Частково це лідерство пов'язане з правильним узгодженням продукту з ринком, а частково – зі скаргами на обмеження безпеки моделей Anthropic та нестачу обчислювальних ресурсів. Кроки OpenAI до більш орієнтованого на людину використання продовжуються з ChatGPT Work, але інженери, з якими я розмовляв, наполягали, що ключовою відмінністю є сила останніх потужних та економічно ефективних моделей OpenAI. 

«Розчаровує те, що часто це модель, і одна з речей, яку ми намагалися зробити дуже добре за допомогою цього застосунку, — це повною мірою використовувати модель», — сказав Амброзіно. 

Що ж, до речі, робить шлейку гарною?

Це пояснення повертає нас до « гіркого уроку », який засвоїли дослідники штучного інтелекту, що краща загальна модель важливіша за досвід конкретної предметної області. Для справжніх вірян уніформа — це тимчасова милиця, а не рів.

«Ви можете отримати хороші результати в короткостроковій перспективі, додавши цілу купу додаткових елементів — якщо і тоді та інструменти — але, типу, наступна модель вийде через пару місяців і зробить це застарілим», — сказав Гершенсон TechCrunch. Його команда зосереджується на найпростіших способах ознайомлення моделі з необхідними їй інструментами та контекстом — і не більше. 

«Мета гарної інженерії джгутів полягає в тому, щоб… точніше визначити, яка інформація дійсно потрібна моделі для вирішення вашої проблеми, оскільки моделі стають дедалі кращими в цьому, якщо просто дозволити їм робити свою справу», – сказав Гершенсон.

Однак залишається відкритим питання, чи готові до цього більшість людей або моделей. Ітан Моллік, професор Вортонської школи бізнесу, який вивчає інструменти штучного інтелекту на робочому місці, все ще вважає Клода більш зручним для користувача, пишучи , що «ChatGPT, як правило, хоче творити дива та просто робити це за вас, тоді як Клод проводить порівняння та показує їх, неодноразово запитуючи інформацію та зворотний зв'язок, а також проводячи A&B-тести».

Соттьо, і, можливо, OpenAI загалом, не погоджуються, стверджуючи, що розмовний характер застосунку кращий, ніж навчання користуванню ним. «Ми точно бачимо, що світ, здається, готовий», — каже він про застосунок. «Ось чому ми досягли неймовірного успіху».

Тим не менш, незрозуміло, чи є специфічний для моделі хандінг взагалі правильним вибором для максимізації моделі. Порівняння, проведені такими компаніями, як Composio та Databricks, показують, що різні комбінації хандінгів та моделей забезпечують різну продуктивність у тестах кодування. Databricks виявили, що Pi, хандінг з відкритим кодом, опублікований програмною компанією Earendil, перевершив Codex, використовуючи ту саму модель GPT 5.5. Pi використовувався для створення таких проектів, як OpenClaw та Cloudflare OS. 

Творець Pi, Маріо Цехнер, каже, що його навмисно мінімалістичний підхід є доказом того, що підхід зі штучним штучним інтелектом може працювати, принаймні для розробників програмного забезпечення та завдань кодування. Він каже, що брак явних функцій компенсується здатністю самостійно модифікуватися та створювати власні інтерфейси. Він співчуває виклику, з яким стикаються інженери OpenAI, розширюючи свою базу користувачів за межі інженерів.

«Все формується агентом кодування… причина полягає в тому, що в них є лише навчальні дані для завдань агента кодування», – сказав він TechCrunch. «Скажімо, я працюю в управлінні, я приймаю рішення сьогодні, а результат відбувається через місяці. Ви не можете зафіксувати це в простому відстеженні взаємодії користувача та агента, тому всі ці завдання та все, що ви не оцифруєте, недоступні для моделі для навчання».

Як і інші постачальники програмного забезпечення з відкритим кодом, він розглядає зусилля великої лабораторії щодо просування своїх можливостей як спосіб закріпити користувачів; «Їм потрібно володіти всім стеком; інакше вони просто стають постачальниками моделей, а потім їм доведеться конкурувати з китайськими моделями». 

Він та інші інженери, з якими спілкувався TechCrunch, вважали, що розуміння витрат токенів та поведінки агентів у передових лабораторіях занадто обмежене. У певному сенсі це менш значуще для нетехнічних працівників, але, як і у випадку з інструментами кодування, масштаби використання, на які сподівається OpenAI, зрештою призведуть до більш жорстких дискусій щодо вартості. 

Наприклад, експериментуючи з підпискою вартістю 20 доларів на місяць, я використав понад 80 мільйонів токенів за чотири дні, що, згідно з аналізом моделі, коштувало 65 доларів (у додатку немає панелі інструментів). Це субсидія, яка більш ніж утричі перевищує вартість підписки лише за чотири дні звичайного використання.

«Ми щодня працюємо над тим, щоб розширити межі ефективності», – сказав Соттьо, вказуючи на нещодавнє зниження ціни на 80% для користувачів моделі Luna від OpenAI. «Якщо ви прокинетеся через шість місяців, ви зможете виконувати всі ті ж [завдання] з меншими витратами».

Інше актуальне питання полягає в тому, чи створюють ці додатки ефект прив’язаності до клієнтів через збереження даних, чи через суцільний клопіт із налаштуванням доступу до всіх плагінів та їхніх дозволів. 

У штаб-квартирі OpenAI, обшитій дерев'яними панелями та наповненій рослинами, яку я відвідав у липні, панувала спокійна, але трохи напружена атмосфера; це люди, у яких багато справ. Інженери, з якими я розмовляв, постійно стежили за своїми ноутбуками під час нашої розмови та поспішали з кімнати для переговорів до кімнати для переговорів. 

Натан, керівник команди розробників продукту, сказав, що основна увага залишається на «обіцянці чарівної скриньки, але я все ще вважаю, що тут забагато складнощів…

Джерело матеріала
loader
loader