Чи Варто Платити За Двох “Розумних” Водіїв? Розбираємось, Хто Кращий: Astra чи Fable
Я часто проводжу аналітичні дослідження, і мої колеги знають, що я не люблю компроміси, коли йдеться про вибір інструментів. Нещодавно мій друг, Олег, який займається розробкою, звернувся до мене з типовою для цієї галузі проблемою: “Ліло, я хочу мати найкращий ШІ для роботи, але це як обирати між двома космічними кораблями. Обидва вражають, але платити за обидва – це вже занадто”. Його роздуми влучно відображають реалії сьогоднішнього дня: штучний інтелект розвивається експоненційно, і назви на кшталт GPT Astra та Claude Fable звучать як обов’язкові атрибути для тих, хто прагне залишатися на передовій. Проте, коли доходить до реальних витрат, питання “чи варто?” стає критичним.
Саме тому я вирішила взяти це питання під власний контроль. Навіщо платити за два, коли можна глибоко розібратися, хто з них дійсно вартий ваших інвестицій, а хто – ні? Я провела серію реальних тестів, перетворивши типові робочі завдання на детальне порівняння. Ми поставимо Astra та Fable “віч-на-віч” у шести конкретних сценаріях, які максимально наближені до щоденної роботи: від роботи з файлами та кодом до глибоких досліджень та автоматизації складних робочих процесів. Забудьте про маркетингові обіцянки; ми будемо фокусуватися на вимірюваній цінності. Тож, приготуйте свої чашки кави, тому що ця подорож обіцяє бути пізнавальною.
Розділ 1: Хаос у Таблицях – Хто Збереже Ваш Фінансовий Борщ?
Перше завдання – це те, що рідко потрапляє до блискучих рекламних демо. Це сувора реальність. Я підготувала два файли: один – типовий “хаотичний” робочий аркуш, який часто надходять від фінансових відділів, а другий – 30-сторінковий PDF з ідентичними даними. З однаковим запитом, без жодної модифікації, я звернулася до обох моделей.
Перш за все, я звернула увагу на те, чи моделі коректно обробляють структуру файлу. Чи відкрили вони всі аркуші, чи обмежилися першим і почали “вигадувати” решту? У моєму файлі рядок заголовків був об’єднаний зверху трьох аркушів. Я розгорнула вихідний файл поруч із відповіддю ШІ. Якщо модель сприйняла ці об’єднані комірки як порожні, всі значення під ними зсунулися б на колонку ліворуч. Порівняння заголовків “пліч-о-пліч” дозволило миттєво виявити цю помилку.
Далі, я зосередилася на згрупованому звіті. Я порахувала рядки з місяцями. Дата в колонці навмисно містила два формати, щоб модель, яка їх розпізнає, показала той самий місяць двічі. Така помилка одразу помітна за кількістю рядків, а не закопана десь у формулі.
І найважливіше – я натиснула на кожне посилання для завантаження. Чистий стовпчик у чаті – це не результат, коли запитували сам робочий файл. Ось де справжня перевірка: дві формули у робочому аркуші посилалися на аркуш, який хтось вже видалив. Це пастка! Вихідні числа вже неправильні, перш ніж ШІ взагалі до них доторкнеться. І це те, що гарний звіт ніколи вам не покаже. Модель, яка сліпо довіряє значенням у комірках, впевнено “узгодить” дані з цими помилками.
Я витягла три ключові числа з кожного звіту: дохід, значення аномалії та узгоджену суму. Потім я перевірила їх вручну, дивлячись на оригінальні комірки в режимі реального часу, з відкритою панеллю формул. Це не “вибірковий контроль”, це відстеження, куди вказують ці два зламані посилання, число за числом. Модель, яка “галюцинувала” одне з цих трьох чисел, відправила б неправильний звіт на чиюсь зустріч, і ніхто б цього не помітив.
Особистий досвід: Обидві моделі впоралися із виявленням основних помилок. Однак, Fable продемонструвала вищий рівень довіри, повернувши не лише виправлену таблицю, але й створивши новий аркуш, де детально перерахувала та пояснила три аномалії, які я “заховала”. Astra надала правильні цифри при ручній перевірці, але сам файл залишався “мовчазним”. Жодних нотаток, жодного нового аркуша – просто виправлений робочий документ без пояснень. Якщо саме вам доведеться пояснювати цей файл своєму керівнику, весь той час, який ви витратили на пошук відповідей у чаті, виявиться марним. Ви закінчуєте продуктивну сесію з реальним планом дій, але вам все одно доведеться створити те, що ви надсилаєте. Це значна прогалина у функціональності.
Цікаво знати: Чи знали ви, що навіть найпотужніші ШІ можуть “загубитися” у складності форматування? Об’єднані комірки, різні формати дат – це для них справжні головоломки, які можуть призвести до серйозних помилок у даних.
Розділ 2: Майстерня Дизайну – Де ШІ Стає Вашим Співробітником
І ось тут я хочу зробити паузу і поговорити про те, що дійсно може змінити правила гри. Ця частина статті підтримується Gamma, і саме їхні нові конектори покликані закрити ту прогалину, про яку ми говорили. Gamma – це інструмент дизайну на базі ШІ для створення презентацій, документів та веб-сайтів. А їхня нова функція – конектори. Ви активуєте їх один раз у налаштуваннях зв’язків ChatGPT, і після цього Gamma з’являється прямо у вашому чаті. Це займає лічені секунди.
Я попросила створити презентацію для запуску кампанії. Запит був простим: “Мені потрібна презентація для запуску цього курсу, яку я можу поділитися з командою сьогодні”. ChatGPT, маючи контекст усієї нашої розмови, не починає ставити уточнюючі запитання. Він одразу генерує структуру і відправляє її в Gamma. Потім у ланцюжку з’являється посилання. Я відкриваю його – і ось готова презентація: титульний слайд, три пункти позиціонування, план розгортання, і зображення вже на місці. Я жодного разу не виходила з ChatGPT, щоб її створити.
Якщо кут подачі не той, я коригую запит у тому ж ланцюжку, і він перебудовує презентацію навколо нової ідеї. Ось у чому суть: ваш ШІ вже розуміє вашу роботу, а Gamma перетворює це на щось, що ви можете реально передати людині. Claude працює аналогічно. Посилання, щоб спробувати нові конектори, є в описі.
Розділ 3: Глибоке Занурення – Хто Розкопає Інформацію Швидше?
Тепер повернемося до нашого порівняння. Друге завдання: глибоке дослідження. І тут якість – це не те, що мене найбільше турбує. Обидві моделі здатні надати солідну відповідь, у цьому я не сумніваюся. Питання в тому, яка з них добереться до мети швидше?
Я відкрила обидва додатки поруч: ChatGPT – на одній половині екрана, Claude – на іншій, із таймером над кожним. Однаковий запит до обох, надісланий одночасно. “Порівняйте поточні тарифні плани, ліміти швидкості та контекстні вікна п’яти найкращих LLM API, і скажіть, яка з них найдешевша для навантаження в 2 мільйони токенів на місяць. Використовуйте живі джерела для кожної цифри”.
Це питання має рухливу відповідь, і в цьому його суть. Сторінки з цінами змінюються, ліміти швидкості оновлюються, тому кожна модель фактично має вийти в інтернет і прочитати актуальні сторінки, а не відповідати зі своєї пам’яті. Саме це робить таймер значущим. Глибоке дослідження та тривале обдумування займають час, і справедливе питання: чи купує цей час кращу відповідь, чи просто пізнішу? Швидкість – це заголовок, але швидка відповідь із минулорічними цінами нічого не варта.
Тому я також перейшла за посиланнями на джерела, вказані в відповідях. ChatGPT завершив першим за 1 хвилину 42 секунди, і я отримала відповідь на кожне запитання. Claude завершив ту саму роботу за 6 хвилин 40 секунд. Обидві моделі виконали чудову роботу. Знайдена інформація була коректною, і за точністю вони не відрізнялися. Вся різниця – у швидкості, і це майже 5 хвилин. Для одного дослідження це не є критичним. Але бувають дні, коли вам потрібно 10 таких запитів, і тоді це різниця між приблизно 17 хвилинами очікування та понад годиною. Якщо дослідження – це те, що ви робите масово, швидкість – це те, за що варто платити.
Не робіть так, як я колись робила: Не полінуйтеся перевірити джерела! Навіть найшвидший ШІ може видати застарілу інформацію, якщо не переконатися, що він дивиться на актуальні дані.
Розділ 4: Код, Що Співає – Або Ламається?
Четверте завдання – це вже не просто бенчмарки, а реальний шматочок коду. Виправлення чужої помилки тестує інші навички, ніж написання нового коду. Нікому не потрібна ще одна програма для списків справ. Тому цей тест має дві половини, і перша – складніша.
Я дала обом моделям однаковий фрагмент коду з конвеєра даних, де була реальна помилка. Та, що потрапляє у продакшн, бо тести проходять. Два робочих процеси записують дані до одного лічильника пакетів без блокування. Отже, приблизно один раз на кілька тисяч рядків, запис рахується двічі, і денна сума трохи спотворюється. Це не призводить до збоїв, просто ваші цифри стають неправильними таким чином, що проходить рев’ю коду.
Запит просив виправити помилку і пояснити її першопричину. Це саме той поділ, який мене найбільше цікавить у коді моделей. Один тип відповіді називає проблему, вказує на спільний лічильник і змінює чотири рядки. Інший – шукає збіги зі словами “вищий лічильник”, огортає все блоком try, додає логіку повторних спроб, яку ніхто не просив, і повертає файл удвічі довший, але все ще зламаний. Обидві відповіді звучать однаково впевнено, коли ви їх читаєте. Єдиний спосіб їх відрізнити – прочитати diff, що ми і робимо на екрані рядок за рядком для обох моделей.
Частина B – це “one-shot build”, і ця частина повністю пропускає термінал. Той самий запит до обох: “Напиши мені один HTML-файл, який візьме той самий брудний CSV і перетворить його на робочий інтерактивний дашборд з фільтрами та графіком, і він має відкриватися і запускатися з першим подвійним кліком”. Ніяких подальших повідомлень, жодного копіювання та вставляння помилок, ніякого дозволу мені його підштовхувати. Я одразу кидаю результат у браузер на екрані. Натискаю на фільтри в режимі реального часу, і те, що відображається, є вердиктом. Якщо графік залишається порожнім або фільтр нічого не робить, коли я натискаю, це провал просто на ваших очах. Не потрібно терміналу, щоб це побачити.
Особистий досвід: Обидва агенти швидко знайшли помилку типу race condition, яка могла б зайняти мій цілий день. Частина B розділила їх за швидкістю, а не за якістю. Дашборд Fable працював бездоганно з моменту його відкриття. Він коректно обробляв мій реальний файл, і кожен зв’язок між колонками тримався. Astra також досягла мети, хоча й трохи повільніше, і надала інший макет із тією ж функціональністю. Те саме завдання, той самий результат. Fable просто дійшов першим.
Розділ 5: Простір, Де Мислення Стає Об’ємним
Четверте завдання – це вже не код, а просторове мислення. Той тип, який не може захопити жодна таблиця порівнянь. Відео запуску Astra приділяє значну частину свого часу 3D-моделюванню, створюючи деталі з одного речення та обертаючи їх на поворотній платформі. Тож, давайте спробуємо саме це. Я попросила саму 3D-модель, одну конкретну механічну деталь, і повернути її як файл, який я можу відкрити. Потім я перевірила, що надійшло, порівняно зі специфікацією. Вимір за виміром, деталь або відповідає, або ні.
Деталь – це L-подібний кронштейн з реальними обмеженнями. Специфікація включає точні загальні розміри, чотири монтажні отвори з певним кроком, різьбовий втулок у кутку та скруглення там, де зустрічаються дві грані. Кожен з цих пунктів – це число, яке я можу виміряти безпосередньо на готовій деталі. Отже, жодна модель не може “обійти” неправильну відповідь.
Особистий досвід: Коли я відкрила перший файл, усі розміри перевірялися під час вимірювання. Плита 80×60, чотири отвори з кроком 40 мм, втулок точно в кутку. Скруглення – тільки там, де вказано в специфікації. Звіт у чаті сказав те саме. І вперше звіт і деталь справді збігаються.
Модель Astra, на жаль, продемонструвала проблеми. Без помилок вимірювання, розміри – не проблема. Різання двох отворів мало залишити плоскі грані з чистими круглими отворами. Натомість поверхня зруйнувалася в стиснуті трикутники, що накладаються, а отвори плавали біля кута, замість того, щоб проходити крізь плиту. Плоскої поверхні не залишилося, тому я нічого не могла виміряти. Найімовірніше, вона вирізала отвори до того, як базовий корпус був завершений. Порядок кроків порушено.
Потім йде подальше доопрацювання, яке насправді їх розділяє. Я не давала конкретних вказівок щодо відсоткового зменшення ваги або місця різання. Єдине правило: точки навантаження залишаються на місці. Хороша відповідь видаляє матеріал з пласкої середини веб-сторінки, залишаючи кути та опорні майданчики недоторканими, оскільки саме там відбувається навантаження. Модель, яка міркує про форму, вирізає кишені або додає ребра в правильних місцях. Модель, яка міркує про токени, просто масштабує весь об’єкт вниз і називає його легшим, що технічно вірно, але абсолютно марно. Astra вирізала свої два отвори посередині веб-сторінки, утримуючись від кутів та опорних майданчиків, не сказавши мені жодного слова про те, куди йде навантаження. Це правильний вибір, і саме тому деталь виглядає так, ніби скинула приблизно п’яту частину своєї ваги. Fable обрав безпечніший шлях і додав третій отвір. Це, ймовірно, краще витримає справжнє навантаження. Ми не можемо сказати на око. Тільки кронштейн, що несе реальне навантаження, покаже, хто вгадав правильно.
Розділ 6: Довгий Контекст – Чи Залишається ШІ Вірним Правилам?
П’яте завдання – це випробування контекстного вікна, що перевищує 100 сторінок, і перевірка, чи дотримується модель правил, коли дістається до них. Всі цитують контекстні вікна, і майже ніхто не тестує, що відбувається всередині них. Тому я зібрала пакет приблизно з 150 000 токенів з трьох документів, які могли б опинитися в тій самій папці проекту: довгий запис зустрічі, підписаний контракт та технічна специфікація. Потім я “заховала” одне протиріччя між двома з них. У транскрипті всі погоджуються щодо дати доставки, а в контракті вказана інша дата в пункті про штраф. Жоден документ не суперечить сам собі. Ви помітите це, тільки якщо насправді триматимете обидва в голові одночасно.
П’ять обмежень у цьому запиті, і вони там навмисно. Знайти протиріччя – це легка половина. Складна половина – це дотримання ліміту слів, трьох точних заголовків, забороненого слова, правила без маркованих списків та необхідної таблиці в кінці, все в одній відповіді. Ось де флагманські моделі тихо програють, і ніхто про це не знімає відео. Вони починають чисто, б’ють по заголовках, а потім приблизно на 2/3 відповіді дисципліна форматування просто випаровується. З’являється маркований список. Кількість слів перевищує ліміт. Таблиця надходить у вигляді блоку markdown, який відображається як стіна з труб.
Особистий досвід: Тому я оцінювала це за чек-листом на екрані, а не за “вайбом”. Сім рядків: два для відповіді та п’ять для правил. Я рахувала слова за допомогою лічильника, що відображається, і шукала кожну відповідь на заборонене слово, а не довіряла своїм очам. Поки Astra ще вмикала потрібні їй навички, Claude вже мав відповідь на екрані. Швидкість не входить до чек-листа. Але на 150 000 токенах ви відчуваєте кожну секунду цієї ваги.
Обидві моделі знайшли протиріччя: 15 березня в транскрипті проти 28 лютого в контракті. Обидві також назвали дату, яка насправді зв’язує вас. Це 28 лютого, та, що пов’язана з пунктом про штраф, а не та, про яку всі голосно домовилися. Кожна відповідь має рівно три заголовки: “Висновок”, “Ризик” та “Рішення”, і жодного маркованого пункту. Забороненого слова ніколи не з’являється, і обидві закінчуються двоколонковою таблицею. Єдиний рядок без галочки – це ліміт слів, тому що жодна відповідь не надала мені кількість слів. За чек-листом це нічия. Fable бере перемогу лише за вагою.
Розділ 7: Повна Автономія – Хто Зробить Все Без Вас?
Шосте завдання – це одне завдання з чотирма кроками, які залежать один від одного, і для обох моделей увімкнені інструменти. Дослідити трьох конкурентів, створити порівняльну таблицю, написати односторінковий звіт на основі цієї таблиці та створити графік як зображення. Кожен крок потребує попереднього. Я вставила однакове завдання в обидві моделі і не торкалася клавіатури, доки кожна не сказала, що вона закінчила. Жодна з них не потребувала мене. Обидва забіги пройшли від дослідження до готового звіту без жодного підштовхування, і жодна не вдавала, що закінчила крок, який пропустила.
Особистий досвід: Єдина справжня розбіжність виникла біля графіка. Я навмисно попросила зображення, знаючи, що Claude не може генерувати зображення. Fable знайшов вихід і показав мені правильний графік. Astra ж просто згенерувала чисте, читабельне зображення з таблицею на ньому, що саме й було запитано в завданні. За самим завданням це нічия. Обидва агенти самостійно виконали всі чотири кроки, тому кількість втручань з обох сторін – нульова. Перевага з’являється лише тоді, коли файл зображення є фактичним результатом. У цьому випадку Astra надає те, що ви просили. А Fable надає розумний обхідний шлях для графіка, призначеного для слайд-деку. Я б із задоволенням взяла будь-який з них.
Підсумки: Хто Той Ваш Ідеальний Цифровий Друг?
Шість завдань, шість вердиктів, і жодного чіткого переможця на дні. Це не я ухиляюся від відповіді. Обидві моделі сильні, але по-своєму. Саме ця “незбалансованість” змушує людей платити за дві передплати флагманських моделей одночасно. Тож не підсумовуйте вердикти. Подивіться, які завдання взяла кожна з них. Потім знайдіть ту, яка відповідає роботі, що відкрита на вашій машині прямо зараз.
Ось як я б насправді це зробила. Одна модель залишається відкритою як вікно за замовчуванням, те, куди ви вставляєте запити, не замислюючись. Цей вибір стосується завдань з файлами та довгим контекстом, бо це більша частина звичайного робочого тижня. Інша модель не отримає постійну вкладку. Ви відкриваєте її для окремого класу роботи, де вона явно перемогла, і знову закриваєте. Це рішення про маршрутизацію, а не про лояльність. Це також спосіб платити за одну флагманську модель плюс періодичний доступ до другої, а не за дві повні передплати щомісяця.
Якщо ви обираєте одну і тільки одну, почекайте на завдання, яке коштує вам найбільше, коли воно йде не так. Для аналітика це буде електронна таблиця, оскільки “галюцинована” узгоджена сума – це тип помилки, який можна пропустити з першого погляду. Цифра просто виглядає правдоподібно, доки хтось не перевірить її вручну. Розробники повинні чекати на частину про першопричину коду та тестування, а не на одноразовий збірку. Неправильне пояснення спалить ваш день. Слабкий перший драфт спалить 30 секунд. Кожен, хто щодня створює контент, повинен чекати на агентурне завдання, оскільки це єдине тут, що вимірює, чи робота закінчується, поки вас немає за столом. Оберіть завдання, яке відповідає вашим втратам, і рішення перестане бути “вайбом”.
Все, що ви щойно бачили – це знімок із коротким терміном придатності. Обидві компанії випускають версії без анонсів, і одне тихе оновлення може перевернути вердикт за тиждень. Тому ставтеся до вердиктів як до вердиктів цього тижня, а до методу – як до стійкої частини. Той самий запит, той самий файл, одна спроба, три числа, перевірені вручну на камері.
Ось спільна невдача, яку жодна модель не оминає. Дайте будь-якій з них довгу відповідь із жорсткими правилами, і наприкінці з’явиться той самий патерн. Перші параграфи відповідають кожному обмеженню, а остання третина тихо їх відпускає. Жодна компанія не робить бенчмарків для цього, оскільки це стає очевидним лише тоді, коли завдання триває достатньо довго, щоб “розслабитися”.
Особистий досвід: Що це означає для вас, так це незручно і дешево в дії. Припиніть давати будь-якій з них довге завдання з правилами. Розбийте його. Дайте обмеження, отримайте частину, перевірте її, а потім дайте наступну частину. Це гірше, ніж обіцяє демо, і все ще швидше, ніж робити це самостійно.
Перш ніж вирішити, що вам потрібні обидві передплати, проведіть власні шість тестів в одному вікні за один платіж, тому що єдине порівняння, яке має значення, – це те, що проводиться на ваших файлах, а не на моїх. Саме для цього створена моя платформа AI Master. Вона пов’язана нижче, і дозволяє надсилати однаковий запит обом моделям, не платячи за дві. Ми відкриті для співпраці над AI Master, тому зв’яжіться з нами.
На цьому все на цей тиждень. Побачимося в наступному.
Вибір між Astra та Fable – це не про “хто кращий”, а про “хто краще підходить для вашої конкретної задачі”. Я провела вас через шість реальних тестів, показавши, де кожна модель блищить, а де – спотикається. Пам’ятайте, що технології змінюються, але методологія аналізу залишається. Спробуйте ці тести самі, на своїх даних. А якщо хочете полегшити собі життя і працювати з обома моделями без зайвих витрат, зазирніть до AI Master. Це саме той інструмент, який допоможе вам приймати обґрунтовані рішення у світі ШІ. Досліджуйте, тестуйте і не бійтеся платити лише за те, що справді приносить користь!







