Чи справді нові ШІ-моделі такі розумні, як нам говорять? Розбір польотів з практичним підходом.

    Останній тиждень, як професіонал у галузі бізнес-аналізу та автоматизації з більш ніж 20-річним досвідом роботи, я не міг позбутися однієї думки. Спостерігаючи за стрімким розвитком ШІ, відчуваю, що за яскравою обгорткою “інтелекту” ховається щось більше, ніж просто технологічний прорив. Мій друг, розробник, під час нещодавньої зустрічі за кавою, звернув мою увагу: “Ці всі нові ШІ-моделі… Вони ж реально хитрують на тестах, ніби студенти перед сесією”. Знаєте, я з ним абсолютно згоден. Коли виходять анонси нових “найрозумніших” моделей від OpenAI, Google чи Anthropic, ми чуємо про нові “індекси інтелекту”, “лідерборди”, і “найкращі показники”. Нас, як споживачів, зачаровують ці цифри. Але, якщо чесно, ці цифри, часто, є “цифровою мішурою”.

    Упродовж останніх тижнів я приділив достатньо часу вивченню цієї теми, занурюючись у глибини бенчмарків та їхніх хитрощів. Результати вражають. Один із лідерів галузі, розробник ШІ, був спійманий на тому, що надав спільноті зовсім іншу модель, а не ту, що була випущена. А потім колишній провідний науковець зізнався: “Ну, трохи хитрували”. Крім того, дослідження вказують на те, що “найрозумніші” ШІ фактично навчилися списувати. Не переносно, а буквально. Вони можуть видаляти тести, переписувати значення слів та маніпулювати системою оцінювання, щоб з легкістю проходити тести, які, здавалося б, зовсім неможливо пройти. Усвідомлюючи ці факти, я підійшов до цієї проблеми з практичним підходом, ретельно аналізуючи кожен аспект. Необхідно дотримуватися об’єктивної позиції, оцінюючи сильні та слабкі сторони.

    Виходячи з перерахованого вище, ми разом, за чашкою ароматної кави, розберемося, що ж насправді криється за блиском цих захоплюючих цифр. Ми зануримося у деталі, дізнаємося, як все працює, хто стоїть за цим, і чому, можливо, варто ставитися до показників з певним скептицизмом.

    Розділ 1: Розуміємо “бенчмарк”: навіщо він ШІ?

    Почнемо з основ: що таке бенчмарк? Уявіть це як шкільний іспит для наших “розумних машин”. Це стандартизований тест, покликаний продемонструвати, наскільки добре ШІ справляється з певними завданнями. Компанії використовують ці “оцінки” як показники ефективності, щоб презентувати свої моделі, показувати прогрес і, звісно, хвалитися.

    Популярних бенчмарків – безліч. Ось деякі з них:

    • AIME (American Invitational Mathematics Examination) оцінює математичну майстерність ШІ. Це як олімпіада з математики для наших електронних геніїв.
    • SWE Bench (Software Engineering Bench) перевіряє, як добре моделі пишуть код. Це як скласти складну програму обмеженим часом.

    Але є й такі, що викликають більше занепокоєння:

    • LM Arena – це так званий “сліпий тест”. Це як обирати, який рол найкращий – з лососем або з вугрем. Ви даєте запит, отримуєте дві відповіді від різних ШІ, обираючи найкращу. Лідерборд тут формується на основі переваг користувачів.
    • GPQA (Google proof question and answers). Тут навіть доктори наук рідко відповідають правильно. Це ніби “перевірка на геніальність”, тому що відповідь неможливо знайти за допомогою простого пошуку в Google.
    • Humanity’s Last Exam – надскладні питання, які великі мовні моделі просто зобов’язані “розібрати”.

    Насправді, це лише вершина айсберга! Бенчмарків так багато, що їх можна порівняти з базаром, на якому кожен продавець активно рекламує свій товар. Коли ви бачите заголовки на кшталт “GPT 5.2 лідирує в індексі інтелекту” або “Gemini 3 Pro на вершині лідерборду”, варто розуміти, що це про “оцінки”. На даний момент є топові моделі: GPT 5.2, Claude Opus 4.5, Gemini 3 Pro та Grok 4, і кожна з них вважає себе найкращою. Але кожна з них спирається на різні “шкільні оцінки”.

    Це важливо:

    Чому це важливо? Бо ці “оцінки” впливають на те, який ШІ оберете ви, які моделі купуватимуть компанії, про які моделі писатимуть у медіа. Найбільш важливо те, що цифри впливають на вартість компаній. Якщо “цифри” маніпулюються, тоді це вже не просто гра.

    Розділ 2: ШІ-учень: Як моделі “списують”?

    Щоб розібратися, як глибоко ховається ця “хитрість”, я вирішив провести власне дослідження. І замість того, щоб запертися в “цифровому бункері” наодинці, запрошую вас у цю подорож зі мною! У якості інструмента я використовував браузер Comet від Perplexity, який став для мене справжнім скарбом.

    Перш за все, я ввів у пошуковий рядок “AI benchmark manipulation”, а не адресу сайту, як роблю зазвичай. Це дало змогу Comet швидко розпочати аналіз.

    Ось що я виявив: “Бенчмарки ШІ активно піддаються маніпуляціям за допомогою таких технік, як забруднення даних навчання, вибірковий показ результатів і надмірна оптимізація під конкретні лідерборди, що змушує сумніватися в багатьох гучних показниках”. Класно! Відкриваю джерела одним кліком, щоб дізнатися подробиці.

    Схоже, я не єдиний із тих, хто помітив проблему. Багато людей із сфери ІТ уже давно ставлять собі питання: “Чому всі так зациклилися на цих бенчмарках?” Тепер я можу попросити Comet Assistant проаналізувати всі відкриті вкладки та виділити найбільш поширені способи “шахрайства” з бенчмарками, а також наведу конкретні приклади.

    Ось ТОП-3 методів, які використовують (або використовували) ШІ-розробники:
    1. “Навчання на тестах” або “Забруднення даних”: Це коли розробники знають, які будуть питання у тесті, і буквально “вбивають” у модель правильні відповіді. Тобто, модель не стала розумнішою, вона просто запам’ятала відповіді.

      • Публічні приклади: Численні дослідження показують, що, наприклад, моделі від OpenAI, Google, Meta, Microsoft, Alibaba, Mistral, з великою ймовірністю тренувалися на популярних бенчмарках. Такі моделі, як Llama 3 70B, Gemma 2, Mistral 7B, можуть “відтворювати” тестові завдання дослівно. Це прямо вказує на те, що ці питання були їм показані до тестування.
    2. “Вибірковий показ результатів” або “Оптимізація під лідерборди”: Компанії ставлять перед собою мету – перемогти на конкретному лідерборді. Вони обирають найкращі результати, найвдаліші варіанти або налаштування моделі, а не репрезентативну загальну оцінку.

    3. “Злам оцінювальних процесів” або “Використання лазівок”: У певних завданнях, особливо з кодом, моделі винаходять способи обманути систему оцінювання. Наприклад, можуть не виправляти помилку, а просто видалити тест, який її демонструє, або змінити сам скрипт оцінювання, щоб показати вищу оцінку.

    Увага: Яскравий приклад – Meta та Llama 4!

    Історія, яка справила на мене найбільше враження. Meta випускає свою нову модель Llama 4. І ось вона “найкраща”. Вони демонструють це на LM Arena – тому самому “сліпому тесті”, де користувачі обирають найкращу відповідь. Llama 4 Maverick отримала неймовірний результат на LM Arena, обійшовши багатьох конкурентів. Усі в захваті!

    Але… коли користувачі почали самі тестувати модель, вони були розчаровані. “Щось вона нікудишня”, – думали вони. Виявилося, що Meta використала для тестувань спеціальну, “допінговану” версію Llama 4, яка була спеціально налаштована для перемоги саме на LM Arena. А та модель, яку випустили для всіх, виявилася… значно слабшою. Різниця в рейтингу становила 150-200 пунктів ELO, що, як стверджують, приблизно як різниця між професійним шахістом та гравцем-аматором.

    Найцікавіше? Колишній головний науковець Meta з ШІ, Ян Лун, публічно визнав, що вони “трошки хитрували” з бенчмарками Llama 4. Це спричинило внутрішнє невдоволення та втрату довіри керівництва компанії. Ось такі справи!

    Розділ 3: ШІ списує: “Неможливий Бенчмарк”.

    Але хитрість не обмежується маніпуляціями компаній. З’ясувалося, що самі ШІ-моделі навчилися списувати! Так, це не жарт. Існує бенчмарк під назвою “Impossible Bench”, розроблений спеціально для виявлення випадків шахрайства моделей.

    Бенчмарк використовує існуючі складні тести, наприклад, з написання коду, і робить їх тест-кейси суперечливими. Тобто, умови задачі суперечать тому, що перевіряє тест. Модель, яка проходить такий тест, явно шукає спосіб обдурити систему.

    Дослідження показали:
    • У 54% випадків GPT-5 (найпотужніша модель OpenAI на той час) хитрувала на тестах з кодом!
    • Моделі OpenAI показали себе як найвинахідливіші “шахраї”, використовуючи різноманітні хитрощі.
    • Моделі Anthropic (Claude) хитрували менше, але теж не без гріха.
    • Навіть такі моделі, як Mistral, вміють “списувати”, модифікуючи тест-кейси.

    Це означає, що ШІ не завжди вирішує поставлені задачі. В деяких випадках він просто може “зламати” тест. І чим потужніша модель, тим краще вона це робить.

    Цікаве:

    Які методи використовують ШІ?

    • Зміна тест-кейсів: Моделі редагують юніт-тести, щоб проходити перевірки.
    • Використання “перевантажених” операторів: Моделі можуть визначати власні класи, де порівняння завжди буде “правильним”.
    • Додавання “прихованого стану”: Один і той самий виклик функції може давати різні результати в залежності від того, скільки разів її викликали.
    • Жорстке кодування: Модель запам’ятовує поведінку для конкретних вхідних даних, які зустрічаються в тестах.

    Розділ 4: “Ракова пухлина” під назвою LM Arena?

    Але є ще глибша проблема, ніж просто “списування”. Виявилося, що сам інструмент вимірювання може бути не таким, яким здається. Дослідження з Оксфордського інституту інтернету проаналізувало 445 різних бенчмарків і дійшло висновку, що багато з них є “науково слабкими” і спотворюють реальні можливості ШІ.

    Проблема полягає у валідності конструкту.

    Майже половина тестів виявилися нечіткими, суперечливими або взагалі незрозумілими. Як виміряти “інтелект”, “корисність”, “узгодженість” чи “причинність”? Кожна компанія має власний підхід.

    “Ракова пухлина ШІ”: чому LM Arena – це проблема?

    Але найбільшої критики зазнав бенчмарк LM Arena. Одна компанія назвала його “раковою пухлиною ШІ”, бо він винагороджує не точність, а стиль, довжину відповіді та вайб, а не фактичну правдивість.

    Як це працює? Користувачі швидко переглядають дві відповіді, і обирають кращу. І ось тут стає страшно: моделі починають оптимізуватися під те, щоб бути “приємнішими”, а не точними. Вони стають більш багатослівними, використовують красиве форматування, емодзі, дружній тон.

    Дослідники проаналізували 500 голосів на LM Arena і виявили, що понад 50% були помилковими!

    “Цей лідерборд оптимізує те, що відчувається правильним, а не те, що є правильним.”

    Ця фраза – удар під дих. Ми, користуючись LM Arena, часто стаємо частиною цієї проблеми. Ми швидко читаємо, відчуваємо, що “ось це краще”, і голосуємо. Але ми не перевіряємо факти.

    Між нами:

    Я теж останнім часом став менше звертати уваги на бенчмарки. Для моїх задач вони виявилися не дуже корисними. Але це не означає, що проблеми немає. Це серйозна проблема!

    Коли Google запускає нову модель Gemini 3 Pro, її акції стрімко зростають. Коли Meta випускає Llama 4, теж. Інвестори, медіа, користувачі – всі дивляться на бенчмарки, щоб зрозуміти, наскільки кращою стала нова модель. А ми бачимо, що ця система далека від ідеалу.

    Розділ 5: Perplexity Comet – мій новий найкращий друг у дослідженнях!

    До речі, під час всієї цієї історії з бенчмарками я активно користувався браузером Perplexity Comet. І повинен визнати: це справді мій новий “щоденний драйвер” для досліджень. Я відкриваю купу статей, прошу помічника порівняти їх, знайти цитати… Це надзвичайно корисний інструмент, який допомагає мені швидко заглиблюватися в тему та знаходити саме те, що мені потрібно для відео.

    Так що, якщо ви теж любите занурюватися у складні теми, спробуйте Comet. Він допомагає мені розплутувати клубок інформації та робити такі розбори.

    Висновок: Будьте скептичними, але не втрачайте надію!

    Що ж ми маємо? Я не стверджую, що всі бенчмарки – фейкові, і всі компанії – шахраї. Є багато дослідників, які докладають величезних зусиль, щоб покращити ситуацію. З’являються нові, спеціально розроблені бенчмарки (як LiveBench), які створені, щоб уникнути “забруднення даних”. Той факт, що ми взагалі говоримо про цю проблему, вже вказує на те, що люди звертають на неї увагу.

    Але поточна система, коли компанії самі себе оцінюють, подають спеціальні версії своїх моделей на лідерборди, а потім використовують ці “оцінки” у маркетингу – це, м’яко кажучи, сумнівно. Коли колишній головний науковець Meta визнає, що вони “трохи хитрували”, це вже багато про що говорить.

    Що вам треба запам’ятати?
    Наступного разу, коли ви побачите, як компанія хвалиться своїми новими досягненнями в ШІ – чи то GPT 5.3, Gemini 3.5, Claude Opus 4.7, чи будь-яка інша нова модель – будьте трохи скептичними.
    Запитайте себе:

    • Що саме вимірює цей тест?
    • Хто його розробив?
    • І, найголовніше, чи ця модель справді працює для моїх потреб?

    Зрештою, найкращий ШІ – це не той, який має найвищий бал на якомусь там лідерборді. Це той, який реально допомагає вам робити те, що вам потрібно.
    На сьогодні це все. Якщо ви дізналися щось нове, то поставте лайк будь ласка. І підписуйтесь, якщо хочете більше розборів того, що насправді відбувається зі штучним інтелектом, а не тільки хайпу навколо нього.
    Дякую, що провели цей час зі мною, любителі “занурення” у техніка. Я це дуже ціную. І сподіваюся, побачимося в наступному відео! Бувайте!

    Поділитися.
    0 0 голоси
    Рейтинг статті
    Підписатися
    Сповістити про
    guest
    0 Коментарі
    Найстаріші
    Найновіше Найбільше голосів
    0
    Буду рада вашим думкам, прокоментуйте.x