Чи може штучний інтелект написати ідеальний додаток? Мій досвід з двома “розумниками”
У моїй кар’єрі, яка налічує понад два десятиліття у сфері бізнес-аналізу, автоматизації та штучного інтелекту, я бачив багато технологічних хвиль. Але думка про те, що машина може написати складний, готовий до використання додаток, завжди викликала особливий інтерес. Не просто скрипт, а цілісний продукт, що не потребує безсонних ночей над налагодженням коду. Як хтось, хто проводив безліч годин, розплутуючи лабіринти коду, я глибоко відчуваю цінність такого потенціалу.
Минулого тижня ця потенційна реальність наблизилася до мене. Я вирішив провести експеримент, який, на мою думку, може переосмислити наше ставлення до ролі ШІ в розробці програмного забезпечення. Я взяв два потужні інструменти, Cloud Code та Codex, і поставив їм однакове завдання: створити функціональну альтернативу популярному сервісу для створення форм – Typeform. Я назвав це “цифровим клонуванням”, де мета полягала у відтворенні функціоналу, але зі своїм унікальним підходом.
Моя основна мета була простою: оцінити, як ці “інтелектуальні” системи впораються з комплексним завданням. Чи зможуть вони створити щось справді вражаюче, чи це буде лише набір коду, який виглядає привабливо, але не функціональний? Особливо мене цікавило, чи зможе ШІ зрозуміти відмінність між прототипом та “готовим до продакшену” додатком.
Будьте готові, бо те, що я побачив, змусило мене переглянути свої уявлення про можливості ШІ. Ми вирушимо у подорож, де розберемося, чому два ідентичних запити призвели до кардинально різних результатів: один проект зайняв три дні, інший – лише п’ять годин; один коштував 3000 доларів, інший – 800. Це буде захопливо.
Завдання для “цифрових геніїв”: Створюємо власну “Typeform”
Коли я став перед вибором завдання для ШІ, мені хотілося чогось конкретного, але достатньо складного, щоб дійсно протестувати його можливості. Створення альтернативи Typeform – це ідеальний вибір. Це не просто статична веб-сторінка, а динамічний додаток з інтерфейсом, логікою, можливостями налаштування та, звісно, функціоналом для збору даних.
Я вирішив використати функцію /goal в обох інструментах, надавши їм, як мені здавалося, чітке та однакове завдання: “Побудуй додаток, який буде повноцінною альтернативою Typeform, готовий до випуску, брендований, але при цьому оригінальний.”
Але як деталізувати це завдання, щоб система зрозуміла, що мені потрібен не просто “перший-ліпший” код, а щось, що пройшло через певні етапи розробки? Я розділив процес на три ключові фази:
- Дослідження (Research Phase): На цьому етапі ШІ мав би заглибитись у тему, вивчити принципи роботи Typeform, його сильні та слабкі сторони, а також проаналізувати рішення, які використовують інші подібні сервіси.
- Побудова (Build Phase): Безпосереднє написання коду та реалізація функціоналу.
- Перевірка (Verify Phase): Тестування, виявлення та виправлення помилок, фінальна доводка.
Озираючись назад, я усвідомлюю, що, можливо, цей запит не був ідеальним. Ймовірно, я б додав ще одну фазу між “дослідженням” та “будовою” – фазу планування та мапування всього процесу. Думаю, це б допомогло обом системам створити ще більш зрілий результат. Однак, як то кажуть, “що маємо, те маємо”, і результати все одно були вражаючими.
Важливою частиною мого запиту було чітке прохання не зупинятися на прототипі. Я хотів, щоб система продовжувала досліджувати, будувати, тестувати, виправляти помилки та знову тестувати, доки додаток не стане “дійсно завершеним”. Мені був потрібен продукт, який можна було б випустити на ринок практично одразу.
Отже, обидва “інтелектуальні” помічники отримали однакове завдання. Цікаво, чи змогли вони його інтерпретувати однаково?
Зустрічайте “RealForm”: Перше враження – стильно, але…
Перший додаток, який я отримав, називався “RealForm”. Його створив один з інструментів. Я отримав його, перебуваючи у відрядженні, і вперше оцінив результат на своєму MacBook. Мушу визнати, перше враження було… приємним.
Відразу було видно, що це результат роботи ШІ, але це не той шаблонний “жахливий” ШІ-дизайн, який ми часто бачимо. Геройське зображення, текст, невеликі “пігулки” з посиланнями – все виглядало досить пристойно. Звісно, фон, глибина зображень – все це натякало на штучне походження, але пересічний користувач, ймовірно, не звернув би на це уваги і не подумав би: “О, це сайт, зроблений ШІ”.
На головній сторінці були розділи: “Досвід”, “Надійність”, “Ціни”. Можна було прокручувати сторінку вниз. Була кнопка “Створити приватний чернетку”, яка вела на сторінку реєстрації. Ця сторінка теж виглядала непогано, мала приємний “вайб”.
Але коли я почав процес реєстрації, я побачив, що там є “демо-робоче місце”. Це означає, що повноцінної автентифікації, скоріше за все, не було. Це вже був перший натяк на те, що додаток не зовсім “готовий до продакшену”.
Після реєстрації я потрапив у робоче середовище. Мені запропонували створити “опитування для запуску продукту”. Це було цікаво! Я міг структурувати, як це працює. Екран привітання, можливість редагувати текст, використовувати змінні (наприклад, “оцінка” чи “ціна”).
Я міг додавати різні елементи, гратися з розмірами. Але ось тут почалися перші “але”. Як видалити зайві елементи? Я натиснув “Delete”, і це видалило весь розділ. Це не те, що мені було потрібно.
Коли я почав додавати текст, налаштування, бачити, як виглядають різні типи полів (короткий текст, довгий, email, телефон, вебсайт, шкала думок, завантаження файлів) – я відчув себе трохи… розгубленим. Інтерфейс (UI) був перевантажений. Занадто багато всього. Особливо мене бентежили змінні, які “висіли” зверху, хоча мали бути частиною загального заголовка.
І ось ще один момент: коли я вибрав “шкалу думок”, з’явилося вікно підтвердження, яке вилізло десь збоку. Це вже схоже на UI-баг.
Загалом, здавалося, що цей ШІ чудово впорався з точки зору адміністратора, зосередившись на даних, які потрібно зібрати. Але з точки зору користувача, який створює форму, це було заплутано. Мені здалося, що такий інтерфейс швидко б відштовхнув користувачів, які звикли до простоти Typeform.
Навіть налаштування теми – радіуси, кольори – здавалося, не працювали. Я клікав, але нічого не змінювалося. Це вже не просто “не ідеально”, це вже свідчить про те, що додаток не зовсім функціональний.
Хоча було багато обіцянок, те, що додаток був створений суто з думкою про “демо-версію”, хоча я просив “дійсно завершений продукт”, мене розчарувало.
Зустрічайте “Fora”: Ну, принаймні, зрозуміло!
Тепер переходимо до іншої частини експерименту. Цей додаток, який я тестував вже на своєму ПК, називався “Fora”. І ось тут одразу кидається в очі: дизайн, скажімо так, був… брутальним. Непривабливим. Це виглядало як лендинг, але дуже-дуже простий.
Текст: “Будуйте красиві форми по одному запитанню за раз. Поділіться посиланням і дивіться, як відповіді накопичуються. Самостійно розміщене, приватне та швидке” – це те, що я побачив.
Я почав процес реєстрації. Ім’я “Боб”, email “bobtest.com”, пароль “12345678”. Все пройшло. І тут я побачив, що це теж “вайбкодед” сайт, але, принаймні, як користувач, я зрозумів, що робити. На відміну від першого варіанту, тут не було перевантаженості.
Знайшов ще один баг: мій обліковий запис внизу екрану. Я не міг зрозуміти, що це за кнопка. Виявилося, це налаштування, але я не міг вийти з системи. Навіть при зміні розміру екрану. Це, звісно, не ідеально, але вже краще, ніж повна невизначеність.
Що мені сподобалося – це робочі простори. Можна було створювати різні робочі області, наприклад, “Бізнес”. Це дозволяло перемикатися між ними, і це виглядало досить “слизько”, тобто елегантно.
Створення нової форми – це було вже зовсім інше відчуття. Набагато менш лякаюче. Це виглядало значно більше схоже на Typeform. Можна було обирати режим відображення: “розмовний” (одне запитання за раз) або “стековий” (всі запитання на одній сторінці). Можна було додати прогрес-бар, номери питань, підказки для клавіатури, автозбереження, захоплення часткових відповідей.
Я почав додавати запитання. “Що б ви хотіли покращити?” – відповідь “щастя”. І тут я побачив, що поле типу “короткий текст”, але це була лише одна з опцій. Далі: email, телефон, вебсайт, випадаючий список, вибір зображення, шкала думок, рейтинг, ранжування.
Коли я спробував додати “шкалу думок”, виявилося, що система повторила попередні запитання. Але потім я зрозумів, що це просто треба було переключитися. “Наскільки ви згодні?” – це вже виглядало непогано.
Але тут з’явився інший баг: нумерація питань. Всі вони були “питання 1”. Хоча зверху відображалося “1 з 3”, “1 з 2”, “1 з 1”. Це свідчило про логічні помилки.
Однак, загалом, досвід створення форм був набагато кращим. Додавання логіки (умовні переходи) – це теж було реалізовано. Дизайн: можна було змінювати тему, кольори. Але тут знову ж таки – після того, як я зайшов у налаштування дизайну, повернутися назад було непросто. Треба було використовувати кнопку “назад” у браузері.
Публікація форми дала мені посилання. Я відкрив його, і це виглядало як справжній Typeform! “Я щасливий”, “Я згоден”, “3”, “Google.com”. Відповіді були отримані. Я бачив результати, окремі подання, навіть джерело. Це було вже досить непогано.
Хоча були й певні недоліки, цей додаток, “Fora”, був значно кращим з точки зору функціональності та зручності для користувача, ніж перший варіант.
Розкриваємо карти: Хто стояв за цими додатками?
І ось найцікавіший момент – хто ж стояв за цими двома творіннями? Я думав, що Codex, якого я останнім часом активно використовував, створить щось краще. Але…
Reveal:
- Cloud Code створив “Fora” – додаток, який, хоч і мав деякі UI-баги, але був значно більш функціональним та зручним для користувача.
- Codex створив “RealForm” – додаток, який виглядав естетичніше на першому етапі, але мав менше функціоналу та був перевантажений.
Чесно кажучи, я був здивований. Я очікував, що Codex переможе, але поки що Cloud Code взяв гору. Звісно, це не означає, що Cloud Code завжди кращий. Все залежить від запиту, від того, як ви ставите завдання.
Ціна, Швидкість, Витрачені Ресурси: Ось де справжня різниця
Тепер перейдемо до цифр, які вражають.
-
Cloud Code (Fora):
- Вартість: 832 долари (при використанні API)
- Використані токени: трохи більше 2 мільйонів
- Час: 5.5 годин
-
Codex (RealForm):
- Вартість: майже 3000 доларів (це просто шаленство!)
- Використані токени: майже 11.5 мільйонів
- Час: 61 година (майже 2.5 дні!)
Я був шокований, коли Cloud Code повідомив про завершення роботи. Я вже майже добу працював з Codex, а він все ще думав.
Щодо моделей, які використовувались:
- Codex використовував GPT-5.6 Soul.
- Cloud Code мав такий розподіл: Fable 5, Opus 4.8, Opus 5. Найцікавіше, що Opus 4.8, хоч я і починав сесію з Fable 5, став основним “диригентом”. Можливо, це була якась захисна реакція, і Opus 4.8 взяв на себе основну роль, залучаючи Fable 5. Але, навіть так, він був надзвичайно ефективним.
Архітектура, Агенти, Інструменти: Як це було “під капотом”
Давайте зазирне глибше.
- Cloud Code: 1 головний “диригент”, 35 підлеглих агентів, близько 2800 викликів інструментів.
- Codex: 1 головний “диригент”, 126 підлеглих агентів, понад 32.5 тисяч викликів інструментів.
Тут стає зрозуміло: Codex працював довше, використовував більше агентів, більше токенів, більше інструментів. А Cloud Code зробив менше, але, здається, краще.
Тестування: Баг у кожному “розумнику”
Звісно, в обох додатках були знайдені баги. Це трохи засмучує, але й показує, наскільки складний процес тестування.
- Cloud Code: 296 юніт-тестів, 199 тест-кейсів, 102 браузерні тести.
- Codex: 2300 юніт-тестів, 341 тест-кейс, 391 браузерний тест.
Codex провів значно більше тестів. Здавалося б, це має означати вищу надійність. Але, як ми побачили, це не завжди так.
Що вміє кожен “розумник”? Відкриваємо їхні сильні сторони
Тепер, коли ми бачимо результати, можна визначити, для чого краще підходить кожен інструмент.
-
Codex (RealForm):
- Архітектура та виконання: Codex створив більш операційно зрілу систему з незмінними ревізіями, відновленням після збоїв, безпекою міграції, обробкою паралельності та хмарними межами. Це означає, що його бекенд, на масштабі, можливо, був сильнішим.
- Тестування та надійність: Codex переміг з великим відривом. Він тестував на різних браузерах, мобільних пристроях, проводив навантажувальні тести. Це саме те, де він показав себе як “слухняний виконавець”, який робить все ретельно.
-
Cloud Code (Fora):
- Судження щодо продукту та обсяг: Cloud Code прийняв більш чіткі рішення, зосередившись на цінних відмінностях. Codex намагався охопити 135 можливостей, включаючи дорогі операційні функції. Версія Codex була перевантажена, не думала про користувача, просто будувала заради будівництва.
- Ефективність: Cloud Code показав чудові результати. Його додаток був набагато дешевшим (приблизно 447 доларів, хоча я бачив і 832, є якась невідповідність у логах, але суть одна – значно дешевше) та в 11 разів швидшим, ніж Codex.
Мій висновок: Я часто використовую Codex для виконання завдань, де потрібна максимальна точність та ретельність. Він як той сумлінний працівник, який виконає все, що скажеш, і ще й перевірить. Але для планування, креативу, дослідження – я віддаю перевагу Cloud Code (або, точніше, моделям, які він використовує, як Fable).
Codex, як мені здалося, вимагає більш конкретних, покрокових інструкцій. А Cloud Code краще розуміє високорівневі цілі. Це як з порадами: від професійного потрійного стрибуна ви очікуєте порад щодо потрійного стрибка, а не стрибків у висоту.
Що далі? Натхнення для вашого власного “кодування”
Цей експеримент показав мені, що ШІ – це не магічна паличка, яка сама створить все. Це потужний інструмент, але він вимагає розуміння, як ним користуватися.
- Експериментуйте: Не бійтеся пробувати різні інструменти та різні підходи до запитів. Те, що працює для одного, може не спрацювати для іншого.
- Розумійте свої потреби: Чи вам потрібна швидка ідея, чи глибокий, ретельно протестований код? Від цього залежить, який інструмент ви оберете.
- Навчайтеся “prompt engineering”: Те, як ви ставите завдання, є ключовим. Чим краще ви сформулюєте свою мету, тим кращим буде результат.
- Не сліпо вірте: Слідкуйте за лідерами галузі, але завжди перевіряйте все на власному досвіді. Те, що працює для когось іншого, може не підійти вам.
Штучний інтелект стрімко розвивається, і кожен такий експеримент – це крок до кращого розуміння його можливостей. Нехай ця історія надихне вас на власні відкриття!
Підсумовуючи все вище сказане, ми побачили, що навіть з однаковими запитами, різні ШІ-системи можуть давати кардинально різні результати. Cloud Code виявився більш ефективним та зручним для кінцевого користувача, створивши функціональний додаток швидше та дешевше. Codex, хоч і витратив значно більше ресурсів, продемонстрував глибший підхід до архітектури та тестування. Це підкреслює важливість вибору правильного інструменту для конкретного завдання та вміння ставити завдання так, щоб отримати бажаний результат.
Заклик до дії: А як ви використовуєте ШІ у своїй роботі? Поділіться своїм досвідом у коментарях! Які інструменти вас найбільше вразили, а які розчарували? Давайте обговоримо!







