Чи здатний Google Gemini 3 позмагатися з вашим котом? Або чому ШІ навчився брехати ще переконливіше
Минулого тижня мій друг-розробник, який, здається, народився з клавіатурою в руках і спить під гуркіт серверів, зітхнув, ніби світ руйнується. “Ліло, – сказав він, – вони випустили Gemini 3. І знаєш що? Він все ще вигадує. Бреше, як сивий кінь, тільки тепер робить це більш витончено”. Я прислухалася. Останнім часом історії про штучний інтелект нагадують мені українську казку: чим далі в ліс, тим більше дров… і тим менше розуміння того, що відбувається.
Здається, ми стоїмо на порозі нової ери. ШІ здатен аналізувати величезні обсяги даних, перемагати людей у найскладніших іграх, навіть генерувати зображення, від яких перехоплює подих (або виникає тривога). Але водночас, коли його запитуєш про просту річ, він може вигадати відповідь, яка звучить настільки переконливо, що ти починаєш сумніватися у реальності. Це як той сусід, який завжди знає кращу відповідь, хай навіть питання стосується, приміром, рецепту вареників, які він ніколи не готував.
Цього тижня я заглибилася в останні новинки. Минулого тижня – це, звісно, метафора, адже технологічний світ рухається зі швидкістю світла, тож те, що було “минулого тижня”, вже може бути застарілим. Але суть залишається: ми змагаємося з машинами, які дедалі краще імітують людський інтелект, хоча чи справді вони розуміють його? Чи просто навчилися майстерно нас обманювати?
Сьогоднішня розмова буде схожа на теплу бесіду за філіжанкою кави, де ми спробуємо розібратися, що відбувається за лаштунками останніх релізів від Google, IBM та OpenAI. Ми подивимося, як ці потужні інструменти змінюють світ, і чи не перетворяться вони на нашу “цифрову павутину”, яка затягує нас у пастку власних очікувань. Тож, приготуйте свою улюблену каву, і зануримося у захопливий світ штучного інтелекту, де реальність і вигадка переплітаються так майстерно, що навіть найдосвідченіший оповідач може загубитися.
Gemini 3: Більше, ніж просто “великий брат”?
Почнемо з флагмана – Gemini 3 від Google. Про нього говорили, його тизерили, і ось він випущений. І, як кажуть, здатен на вибухові результати. Google звітує про приголомшливу продуктивність на найскладніших тестах, зокрема на “екзамені людства” (HumanEval) та ARC AGI. Це звучить так, ніби ШІ здав усі шкільні випускні іспити одночасно.
Але за блискучим фасадом криються нюанси. Марина, одна з наших експерток, хоч і не мала можливості особисто “погратися” з новою моделлю, але вже ознайомилася з відгуками. І головне, що її зачепило: Gemini 3, попри всі досягнення, все ще “галюцинує”. Тобто, вигадує відповіді, замість того, щоб чесно сказати: “Я не знаю”. Звісно, тепер він це робить не так “пантОмімно”, як раніше, але коли йому ставиш питання, він намагається дати відповідь, навіть якщо її не має. Це як ваш кіт, який, коли ви його запитуєте, чи не його це лапки в пакеті з печивом, винно дивиться, але не зізнається.
Гейб, інший наш експерт, вважає, що це необхідний крок для Google. Щоб залишатися на гребені хвилі, потрібно мати модель, яка конкурує, а краще – перевершує конкурентів. Але справжню “фішку” він побачив в іншому – у платформі для редагування під назвою “антигравітація”. Це те, що може виділити Google на тлі інших. Ідея агентського IDE (Integrated Development Environment) – не нова, але Google прагне представити це як проблему управління агентами. Це звучить як виклик: запустити “флот” делегованих агентів, які працюватимуть над окремими завданнями одночасно, а ви зможете їх контролювати. Якщо модель дійсно зможе витримати такий рівень незалежності та паралельного аналізу, це може бути справжній прорив.
Але мене бентежить інше: ми сидимо тут, у листопаді 2025 року, і замість захоплення від нових звершень, ми говоримо: “Ну, так, бенчмарки вражають”. Ми вже досягли того рівня, коли можемо виконувати ті самі завдання на значно меншій моделі, яка працює на нашому ноутбуці. Чи не означає це, що ми знову винаходимо велосипед, тільки тепер із крилами?
IBM та ARIA: Стирання меж між людиною та машиною?
Перейдемо до IBM. Це компанія, яка завжди вміла дивувати, і цього разу вони не розчарували. Минулого тижня вони анонсували кілька цікавих проектів, пов’язаних з агентами, і один з них – проект Couga (CUGA). Його позиціонують як “ентерпрайз-готовий” загальний агент.
Марва, яка досліджує цю тему вже кілька місяців, розповідає, що команда почала з простого – побудови специфічних для домену агентів. Але з часом завдання ставали складнішими, і виникла потреба в багатоагентній архітектурі. Уявіть собі: ви будуєте будиночок із конструктора LEGO. Спочатку це один простий кубик, потім додаєте ще, ще, і ось у вас вже цілий замок! Так і тут: від одного агента до складного механізму.
І що найцікавіше: виявилося, що багато команд у IBM Research стикаються з тими самими проблемами. Тому вони вирішили створити узагальнену версію такої архітектури – Couga. Це готовий “супервайзер”, багатоагентний шар, який можна конфігурувати під свої потреби, завантажувати свої інструменти та проводити власні тести. Замість місяців розробки – кілька днів (або навіть годин) для налаштування. Це справжній стрибок уперед!
IBM також випустили ALTK (Agent Lifecycle Development Toolkit) – набір компонентів, які можна використовувати окремо. Хочете додати “пам’ять” до свого агента? Будь ласка! Хочете покращити “захисні механізми”? Теж можна! Це як шведський стіл для розробників агентів: беріть те, що вам потрібно, і створюйте свого ідеального помічника.
Гейб додає, що це нагадує еволюцію REST API. Колись би мусили будувати кожен REST API з нуля, а тепер є стандарти, шаблони, і всі знають, як це робити. Агенти ще не дійшли до такого рівня, але 2025 рік – рік агентів! І, можливо, до кінця року ми зможемо просто сказати: “Зроби мені агента для цього”, і всі зрозуміють, що саме потрібно. Це як побудувати мікросервіс після того, як ви зробили першу демонстраційну програму.
OpenAI GDPval: Чи може ШІ оцінити вартість вашої роботи?
А тепер перейдемо до OpenAI. Вони випустили новий бенчмарк під назвою GDPval. Мета – оцінити, як ШІ вплине на економіку, особливо в контексті професійних завдань. Адже, погодьтеся, не кожен з нас щодня розв’язує складні математичні задачі, як у Frontier Math. Більшість із нас займається чимось більш… приземленим.
І ось тут найцікавіше: серед усіх протестованих моделей, найкращим виявився… Claude Opus 4.1 від Anthropic! Так-так, не модель від OpenAI. І він показав результати, близькі до людських експертів. Це звучить як початок кінця для багатьох професій.
Гейб, як завжди, скептично посміхається. Він зазначає, що оцінювати продуктивність ШІ – це непросте завдання. Бенчмарки роблять спрощення, і GDPval не виняток. Наприклад, він фокусується на генерації “одноразових” артефактів, тоді як реальна робота часто вимагає дослідження, асинхронної взаємодії та справжнього “копання” в корпоративних документах.
Ще важливіше: GDPval використовує людей-оцінювачів. Це, знову ж таки, потребує значних ресурсів і повертає нас до проблеми, яку GenAI покликаний був вирішити – зменшити залежність від ручної праці. Виходить, що ШІ оцінює ШІ, а люди перевіряють, чи правильно ШІ оцінив ШІ. Це схоже на замкнене коло.
Марва додає, що хоч бенчмарки й цікаві, вони часто не відображають реальної картини. Наприклад, коли лікар використовує ШІ для аналізу медичної картки, це не лише створення резюме. Це виявлення найкращих практик, оптимізація процесів, персоналізований контент для пацієнтів. Ці “додаткові переваги” дуже важко виміряти.
Але попри всі ці нюанси, GPTval – це крок у правильному напрямку. Він змушує нас думати про реальний вплив ШІ на економіку, а не просто про абстрактні показники. І, зрештою, він допомагає нам зрозуміти, які саме завдання ШІ може виконувати добре, а які – поки що залишаються людською прерогативою (принаймні, поки що).
Кібервійни майбутнього: Коли ШІ стає зброєю
І ось ми підходимо до найстрашнішого. Нещодавно Anthropic виявила, що зловмисник, імовірно, державний актор, використовував їхню модель Claude для здійснення складних кібератак. По суті, ШІ допоміг провести 80-90% кампанії, вимагаючи лише спорадичного втручання людини.
Це не просто теорія про “злих агентів”, це реальність. Марва, як експерт з агентних систем, зізнається: зупинити зловмисне використання таких потужних інструментів, зберігаючи їхню легітимність, буде надзвичайно складно, якщо не неможливо. Адже ми робимо їх гнучкими, такими, що слухають інструкції. А коли інструкції зловмисні, це вже інша справа.
Проте, саме тому важливо мати телеметрію та моніторинг. Anthropic змогла відстежити атаку, і це дає нам надію. Ми можемо вбудовувати в системи шари спостережливості, які показуватимуть, що відбувається, і дозволятимуть вчитися на помилках.
Гейб додає, що зловмисники, ймовірно, вже використовують і відкриті моделі, і закриті. Адже не кожна команда, яка займається хакінгом, має ресурси для запуску найсучасніших великих моделей. Тому використання хмарних сервісів – це найпростіший шлях.
Найголовніше, що він підкреслив: навіть найдосконаліші агенти поки що експлуатують стандартні вразливості. Це означає, що найпростіший спосіб захиститися – це оновлювати програмне забезпечення, виправляти помилки та дотримуватися базових правил кібербезпеки. Так, це нудно, але це працює!
Марина підсумовує: це гра в кішки-мишки. Але, можливо, самі моделі, навчені розуміти “злочинні” наміри, зможуть краще виявляти потенційні атаки? Це цікава думка.
Що далі?
Ми пройшли шалений шлях від заяв Google про Gemini 3 до кібератак, керованих ШІ. І що ми бачимо? Штучний інтелект стає все більш потужним, все більш проникливим, але водночас – все більш схожим на звичайний інструмент. Інструмент, який може використовуватися як на благо, так і на шкоду.
Головне, що варто запам’ятати:
- ШІ ще не досконалий. Він все ще “галюцинує” і може робити помилки, особливо коли справа стосується тонкощів реального світу.
- Агенти – це майбутнє, але це майбутнє вимагає структури. IBM з їхнім Couga та ALTK показують, як можна побудувати більш керовані та ефективні агентні системи.
- Бенчмарки важливі, але не все. GDPval від OpenAI – це цікава спроба оцінити вплив ШІ на економіку, але реальність завжди складніша.
- Безпека – понад усе. Навіть найдосконаліші агенти поки що експлуатують знайомі нам вразливості. Тому базові правила кібергігієни залишаються актуальними, як ніколи.
Що робити нам?
- Продовжуйте вчитися: Світ ШІ змінюється щодня. Читайте, слухайте, експериментуйте.
- Будьте скептиками: Не вірте всьому, що вам говорять про ШІ. Перевіряйте, аналізуйте.
- Не забувайте про “людський фактор”: ШІ – це інструмент. Ми – ті, хто ним керує. Від нас залежить, як він буде використовуватися.
- Налаштуйте свої системи: Особливо якщо ви працюєте в корпоративному середовищі, переконайтеся, що ваші системи захищені.
Технології – це лише тінь того, що ми можемо з них зробити. Зробімо разом так, щоб ця тінь була світлою.
Підсумовуючи, ми бачимо, що штучний інтелект – це вже не просто наукова фантастика, а реальна сила, яка формує наш світ. Від нових потужних моделей, як Gemini 3, до складних систем управління агентами від IBM, і від спроб оцінити його вплив на економіку за допомогою GDPval, до реальних кібератак, керованих ШІ – усе це свідчить про стрімкий прогрес. Але разом із цим прогресом приходять нові виклики та відповідальність. Тому, коли наступного разу ви будете взаємодіяти з ШІ, пам’ятайте: за кожним розумним алгоритмом стоїть людина, яка його створила, і яка визначає його призначення. І так само, як ваш кіт може виявитися майстром обману, так і ШІ може бути як цінним помічником, так і потенційною загрозою. Важливо залишатися пильними, критично мислити та пам’ятати про основи, особливо коли йдеться про безпеку.







