Коли ШІ ще не вміє грати в ігри: особисте знайомство з ARC AGI 3 – тестом, що змушує нейронні мережі задуматись
Привіт, друзі! З вами Ліла Харт, і сьогодні я збираюся поділитися своїм досвідом роботи з ARC AGI 3, бенчмарком, який змушує сучасні моделі штучного інтелекту червоніти. За два десятиліття роботи у сфері бізнес-аналізу та штучного інтелекту я стала свідком багатьох “проривів”. Однак, як і мій друг-розробник, я часто дивуюся, наскільки далекі ці інструменти від справжнього розуміння та здатності до узагальнення.
Саме здатність розуміти і узагальнювати, а не просто запам’ятовувати, є справжнім викликом для штучного інтелекту. І тут на сцену виходить ARC AGI.
Коли на технічних конференціях ми чуємо про черговий “прорив” у штучному інтелекті, часто за цим стоїть щось, що вже майже досягло досконалості. Моделі здають тести з математики краще за професорів, пишуть код, що йде в ногу з найдосвідченішими програмістами, чи перекладають так, що забуваєш, що це не людина. Але чи означає це, що ШІ став по-справжньому розумним? Чи просто він навчився майстерно здавати конкретні іспити?
Уявіть собі студента, який зубрить підручник напам’ять перед кожним тестом. Він може отримати найвищий бал, але чи здатен він застосувати знання в реальному житті, коли ситуація трохи зміниться? Ось у чому різниця, і саме тут проходить тонка межа між “роботою” штучного інтелекту і справжнім загальним інтелектом.
Сьогодні ми поговоримо про ARC AGI – бенчмарк, який, на мою думку, є одним з найкрутіших інструментів для тестування саме цієї здатності до узагальнення. Я сама, як експерт у цій сфері, переконана, що здатність адаптуватися до нових ситуацій – ключовий фактор істинного інтелекту. Розробники поставили собі мету: перевірити, чи може ШІ не просто вирішувати завдання, які йому дали, а й вчитися на них, адаптуватися і знаходити рішення для абсолютно нових, неочікуваних ситуацій. І, повірте, коли ви побачите, як з цим справляються найсучасніші моделі, ви зрозумієте, чому мій друг, як і я, так скептично ставиться до сучасних досягнень.
Давайте ж розберемося, чому ARC AGI – це не просто черговий тест, а справжній виклик для майбутнього штучного інтелекту.
Розділ 1: Що таке ARC AGI і чому це не просто “хрестики-нулики”
Що ж таке ARC AGI? Якщо розшифрувати, то це “AI-Reflections-on-Human-Cognition” – тобто, “роздуми штучного інтелекту про людське пізнання”. Суть ARC AGI – це перевірка штучного загального інтелекту (AGI), а точніше – його здатності до узагальнення.
Що це означає? Уявіть, що ви навчаєте машину, як варити борщ.
- Звичайний тест: Дати їй всі інгредієнти і сказати: “Звари борщ за цим рецептом”. Вона впорається.
- ARC AGI тест: Дати їй картинки, де на одному прикладі видно, як з двох половинок овочів робиться ціла. Потім інший приклад – три половинки роблять цілу. І спитати: “А як з чотирьох?”
Як людина, я одразу вловлюю логіку: треба доповнити кількість половинок, щоб отримати ціле число 2. Тобто, якщо нам дали три половинки, нам потрібна ще одна, щоб отримати дві пари. З чотирма половинками – і нам не потрібно нічого додавати, адже вже є дві пари. Це і є узагальнення – знайти абстрактний принцип і застосувати його до нової ситуації.
Саме це робить ARC AGI таким особливим. Замість того, щоб завчати відповіді, ШІ має зрозуміти правило. Ось як це виглядає у першій версії ARC AGI:
Приклад 1: Бачимо три рожеві квадрати. Нам показують, що для того, щоб отримати квадрат 2х2, потрібно додати один жовтий квадрат.
Приклад 2: Тепер чотири рожеві квадрати. І знову – додаємо один жовтий, щоб отримати квадрат 2х2.
І ось вам завдання: що робити з п’ятьма рожевими квадратами? Людина одразу бачить: “Ага, все просто! Це вже три квадрати 2х2. Мені треба додати два жовті, щоб отримати три квадрати 2х2”.
Здається елементарно, правда? Але штучний інтелект… ну, йому це дається значно складніше. Для людей це 100% розв’язання. Для ШІ – справжній виклик.
Розділ 2: Від простих загадок до складних лабіринтів: еволюція ARC AGI
Варто зазначити, що перша версія ARC AGI стала лише розминкою. Як експерт, я бачу, що моделі демонстрували вражаючі показники, досягаючи 93-94% успіху. Однак, з моєї точки зору, ці результати не відображають справжній інтелект.
Тому розробники пішли далі – і створили ARC AGI 2. Тут задачі стали значно складнішими. Це вже не просто додати квадратик. Це справжнісінькі головоломки, де потрібно розпізнавати складніші патерни.
Приклад з ARC AGI 2:
Уявіть собі поле з різнокольорових блоків. Нам показують приклади, де за певним правилом блоки змінюють своє положення чи колір. Наприклад, якщо в центрі немає порожніх місць, блок стає жовтим. Якщо є одне порожнє місце посередині, він стає зеленим. Якщо два порожніх місця – синім.
Виявилося, що навіть найкращі моделі, навчені на мільярдах даних, відчувають труднощі.
На графіку ARC AGI 2 ми бачимо, що найкрутіші моделі, такі як GPT 5.4 Pro Extra High, досягають лише 72% успіху. І хочу підкреслити, що вартість такого успіху – аж 39 доларів за завдання! Для порівняння, Gemini 3.1 Pro – 69%, Claude Opus – 68%. Люди ж, як ви здогадалися, все ще на 100%.
З одного боку, це вражає. Найкращі моделі світу, навчені на мільярдах даних, борються з цими завданнями. З іншого боку – це трохи лякає. Як експерт, я бачу потенційну небезпеку: якщо вони не можуть впоратися з цими, здавалося б, простими (для нас!) завданнями, то що буде, коли ми передамо їм складніші, реальніші проблеми?
Розділ 3: “А що, якби…?” – ШІ у бізнесі та новий вимір
Як досвідчений фахівець, я не можу не згадати про вплив ШІ на бізнес. Якщо ви, як і я, активно використовуєте штучний інтелект у своїй роботі і ще не знайомі з Microsoft 365 Copilot Business, то мій вам щирий привіт! Це якби хтось взяв ваші щоденні рутинні завдання і перетворив їх на легкі прогулянки.
Я пройшла шлях від компанії, де все робилося вручну, до тієї, де ШІ – це не додатковий інструмент, а основний двигун. І це просто кардинально все змінює. Уявіть: перегляд юридичних документів, автоматизація робочих процесів, написання коду, дослідження… Це все раніше займало неймовірно багато часу. Зараз же – завдяки ШІ – я можу зосередитися на тому, що справді важливо: креативність, стратегія, людська взаємодія.
Microsoft 365 Copilot – це як ваш напарник, який завжди поруч. Він може допомогти з контрактами (інтегрується з Word), з фінансовим аналізом (працює з Excel), та багато іншого.
Якщо ШІ здається вам лякаючим – це нормально. Як професіонал, я розумію ці побоювання. Але винагорода за його вивчення – величезна.
(P.S. Посилання на розповідь про Copilot та інші корисні ресурси – в описі. Загляньте, це того варте!)
Розділ 4: ARC AGI 3 – коли відеогра стає тестом на геніальність (Мій особистий досвід)
А тепер – найцікавіше! Розробники ARC AGI не просто випустили нову версію, вони перевернули гру. ARC AGI 3 – це перший інтерактивний бенчмарк. Це вже не просто картинки і приклади. Це справжній відеоігровий досвід!
Як професіонал в галузі, я була неймовірно заінтригована. Тож я вирішила випробувати ARC AGI 3 самостійно, щоб скласти власне уявлення.
Прикиньте: вас “кидають” у відеогру. Нульова інформація про правила. Обмежена кількість ходів, щоб зрозуміти, що відбувається, і досягти якоїсь мети. Звучить як страх кожного гравця-початківця, чи не так?
І ось я сама спробувала. Мені дали екран, стрілки для руху, кнопки “reset”, “help” і “select”. Коротше, повна невизначеність.
Моя перша спроба:
Я бачу три крапки, жовту смужку (може, здоров’я?). Знизу – щось, схоже на міні-карту або ціль. Наш персонаж – плюсик. Наша мета – дістатися до верху.
Я натискаю “вгору”. Персонаж рухається. Жовта смужка трохи падає. Ага! Це, мабуть, лічильник ходів. Рухаємося далі. Добрався до верху. Нічого не сталося. Ніби я не пройшов.
Щось блимає, щось не так. Помічаю, що моя “ціль” внизу (мабуть, це те, що мені потрібно “активувати” чи “досягти”) розташована інакше, ніж мета на екрані. Можливо, треба спочатку натиснути ту саму кнопку “+”, щоб “переорієнтувати” мету?
Скидаю гру і починаю знову:
Цього разу, перш ніж рухатися до мети, я натискаю “+”. Є! Тепер “ціль” на моєму маленькому екрані збігається з великою. Тепер рухаюся. І… Так! Гра закінчена. Я впорався!
Скільки часу це зайняло? Хвилину, може, дві, враховуючи, що я ще й пояснювала собі вголос. Це було інтуїтивно, логічно. Миттєве узагальнення на основі спостережень.
Розділ 5: А як справи у ШІ? Повний провал…
А тепер найболючіший момент. Як з цим впорається штучний інтелект? Як експерт у цій галузі, я тестувала найбільш передові моделі. І результати мене, м’яко кажучи, не вразили.
- GPT 5.4: 0%
- Gemini 3.1 Pro (preview): 0%
- Grok 4: 0%
- Claude Opus: 0% (ну, майже, 4.6% – це як “ну, майже 100%” )
Людина – 100%. Загальна кількість ходів, які зробили всі ці “розумники” – 546! Це ніби спробувати пройти лабіринт, знову і знову б’ючись головою об стіну.
Я побачила відео, де GPT 5.4 пробує цю гру. Він робить той самий перший рух, що й я, а потім… просто стоїть. Він не розуміє, що потрібно взаємодіяти з елементами, змінити стан гри. Він не доходить до кнопки “+”. Це просто дивовижно! Адже для нас, людей, це настільки очевидно, настільки природно.
І найсмішніше (чи сумне?) – найуспішніша модель, GPT 5.4, показала результат 0.3%. Вартість – понад 5000 доларів! Це ніби заплатити цілий статок, щоб тобі показали, як ти неправильно стоїш.
Чому ж так відбувається? Чи то тому, що ми, люди, маємо мільйони років еволюції, гри, соціальної взаємодії, які навчили нас інтуїтивно розуміти світ? Чи то тому, що ШІ ще не навчився “грати” у світ, а лише “розв’язувати” завдання? Я вважаю, що відповідь криється в поєднанні цих факторів.
Розділ 6: “Роздуми” штучного інтелекту: чому ARC AGI – це майбутнє?
Як досвідчений аналітик, я бачу, що ARC AGI – це не просто тест. Це філософія. Це виклик.
- **Фокус на вартість завдання:**ARC AGI не дозволяє моделям “спалювати” необмежену кількість ресурсів. Потрібна ефективність, а не просто груба сила. Це як навчитися готувати борщ, використовуючи лише ті інгредієнти, що є вдома, а не бігти на базар за кожною дрібницею.
- Людина проти машини: Це єдиний бенчмарк, де середньостатистична людина випереджає найкращі моделі ШІ. Це робить його унікальним інструментом для вимірювання справжнього, а не вивченого, інтелекту.
- Інтерактивність: ARC AGI 3 виводить тестування на новий рівень. Не просто аналізувати статичні дані, а активно взаємодіяти зі світом, вчитися на ходу, адаптуватися. Це те, що відрізняє живу істоту від комп’ютерної програми.
- $2 мільйони за геніальність: Розробники пропонують величезний приз тому, хто зможе “наситити” бенчмарк, тобто досягти результатів, близьких до людських. Це стимул для дослідників по-справжньому зламати цю головоломку.
Висновок: Наступний етап еволюції ШІ – чи зможемо ми його зрозуміти?
Я вважаю, що ARC AGI показує, як штучний інтелект стає все більш потужним. Він допомагає нам у роботі, навчанні, навіть у творчості. Але ARC AGI показує нам, що до справжнього, людського рівня розуміння – ще далеко.
Це не привід для паніки, а навпаки – для хвилювання! Адже це означає, що попереду ще так багато відкриттів. Це можливість створити ШІ, який не просто виконує команди, а здатний розмірковувати, узагальнювати і розуміти світ так, як це робимо ми.
Що далі?
- Для розробників ШІ: Ваше поле для досліджень величезне! ARC AGI – це ваш шанс показати, наскільки далеко ви можете зайти.
- Для нас, користувачів: Не соромтеся питати. Не бійтеся експериментувати. Вивчайте, як працюють ці нові інструменти. І пам’ятайте: найцікавіше – це не те, що ШІ може зробити сьогодні, а те, що він зможе зробити, коли навчиться по-справжньому думати.
А поки що, давайте просто спостерігати. І, можливо, навіть спробуємо самі розгадати ці ігри. Адже хто знає, можливо, саме у цій грі ховається ключ до створення справді загального штучного інтелекту.
**У підсумку, маємо:**ARC AGI – це не просто бенчмарк, це наступний рівень випробувань для штучного інтелекту, який ставить під сумнів наші поточні досягнення і вказує шлях до майбутнього. Якщо ви хочете зрозуміти, де зараз знаходиться ШІ і куди він рухається, – ARC AGI 3 є найкращим дороговказом.
Заклик до дії: А тепер ваше завдання! Спробуйте самі ARC AGI 3, якщо є така можливість. Або поділіться своїми думками: як ви вважаєте, коли ШІ зможе бездоганно грати в ігри та узагальнювати інформацію, як людина? Чекаю на ваші коментарі!







