Opus 4.7: Чи справді це новий король суперсили, чи просто старий друг у нових чоботях? (Переглянуто старшим редактором з Експертизою)
Привіт, друзі! Ліла Харт з вами, і, як досвідчений бізнес-аналітик з понад 20-річним досвідом роботи в галузі, я сьогодні розберу Opus 4.7. Останніми тижнями на форумах вирують обговорення щодо продуктивності Anthropic, тож давайте з’ясуємо, чи дійсно нова версія виправдає очікування.
Спочатку – трохи передісторії. Мій знайомий розробник, який завжди був обережним і настороженим щодо нових версій, надіслав мені посилання з такою фразою: “Ліло, ти не повіриш, що робиться навколо Opus 4.6 і 4.7. Це якась справжня головоломка!” Я, звісно, не могла залишитися осторонь. Я знаю, коли найпотужніші інструменти починають показувати незвичайну поведінку, це завжди викликає великий інтерес. Нова версія, 4.7, обіцяє багато нового. Тож, чи можна їх сприймати як щось нове та проривне, чи це просто ефективний маркетинговий хід? Почнемо з аналізу попередньої версії.
Акт 1: Розбір Opus 4.6 – Що ж пішло не так?
Перш ніж розглядати нову версію, давайте повернемося до 4.6. Варто відзначити, що поведінка Opus 4.6 була, м’яко кажучи, дивною. Спочатку всі були задоволені: модель видавала чудові результати, її можна було використовувати як надійний інструмент. Але незабаром все змінилося.
Згідно з аналізом приблизно 7000 сесій кодування, проведених старшим директором з AMD, продуктивність моделі знизилася. На мою думку, це викликало багато занепокоєння в галузі. Модель, яка мала бути кодовою помічницею, почала ігнорувати файли перед редагуванням. Її “глибина мислення”, як її називають у цій сфері, впала з 2200 символів міркувань до 600. Це означало, що модель стала діяти поспішно, пропускати ключові етапи та неефективно виконувати завдання.
З мого досвіду, це неприпустимо. Майже на третину часу модель просто ігнорувала важливі файли, що вводить в оману весь процес. Її відмова від належного аналізу негативно впливає на якість коду. Результатом стало збільшення кількості помилок та зменшення продуктивності. Зрозуміло, це стало великою проблемою для багатьох користувачів.
Ще одним тривожним аспектом стало те, що “безлімітні” тарифні плани вартістю 200 доларів на місяць розряджалися протягом години. Чому? Тому що модель неефективно використовувала токени, обробляючи запити. У такому разі витрати перевищують фактичну цінність, яку отримує користувач.
Я помітила деякі інші проблеми, наприклад, помилки хешування, фальшиві назви пакетів, і проблеми з версіями API – на рівні, який важко було ігнорувати. Крім того, слово “найпростіше” (simplest) почало з’являтися у висновках моделі втричі частіше, що натякає на те, що модель почала оптимізувати відповіді, використовуючи мінімум зусиль. Я помітила також те, що модель припиняла працювати над завданням посеред шляху.
Нотатки про особистий досвід: З мого професійного досвіду, виникає питання, чи було це навмисною спробою “прискорити” випуск нової версії. Це досить поширений маркетинговий хід, коли попередню версію навмисно виставляють в гіршому світлі, щоб підкреслити покращення у новій, новій версії.
Як Anthropic намагалися виправити ситуацію: маркетинговий хід?
Після того, як користувачі почали висловлювати своє незадоволення, Anthropic зреагувала. 9 лютого вони заявили про “зміну адаптивного мислення”. На практиці це означало, що модель сама вирішувала, скільки часу витрачати на кожен запит. Якщо запит здавався простим, на міркування виділялося нуль токенів.
Борис Черні, один з розробників Claude Code, підтвердив, що проблеми виникали саме тоді, коли модель витрачала на запит нуль токенів. Коли ж модель витрачала більше часу на міркування, все працювало добре.
Ще однією зміною було скидання рівня зусиль за замовчуванням на “середній”. Раніше користувачі могли вибирати “високий” чи “максимальний” рівень зусиль, але Anthropic їх “вимкнули”, не повідомивши. Хоча це не змінювало саму модель, це впливало на її поведінку.
Ці зміни тривали щонайменше місяць. Навіть користувачі преміальних планів були обмежені середнім рівнем зусиль за замовчуванням. Як наслідок, багато користувачів відзначали, що продуктивність моделі знизилася.
Рекомендація з мого досвіду: Не варто довіряти тим, хто пропонує “найпростіші” рішення, особливо у сфері штучного інтелекту. Це може свідчити про некомпетентність або нечесні наміри.
Акт 2: Opus 4.7 – Король, що повернувся на трон, чи його двійник?
15 квітня Anthropic представила Opus 4.7. Компанія заявила про “значні покращення” в області кодування та інженерії, особливо у складних завданнях. У прес-релізі було сказано: “Користувачі повідомляють, що можуть передавати свою найскладнішу роботу з впевненістю Opus 4.7”. Звучить обнаджливо, чи не так?
Що ж змінилося?
- Адаптивне мислення повернулося: Модель знову може динамічно вирішувати, скільки часу їй потрібно для міркувань.
- Режим “X High” – новий, ще вищий рівень зусиль, доступний лише у 4.7.
- Команда
/ultra-review: Нова функція для спеціального перегляду коду. - Покращена візія: Модель нібито краще сприймає візуальну інформацію.
- Більше інформації: Розробники вирішили проблему з ігноруванням інструкцій.
- Зменшення галюцинацій: Модель може знаходити логічні помилки на етапі планування.
- Безпека та узгодженість: Модель стала безпечнішою, а також добре себе почуває у питаннях кібербезпеки.
На мою думку, всі ці зміни точно відповідають тим зауваженням, які висловлювали користувачі 4.6. Звісно, це добре, що проблеми вирішують. Але виникає питання: чи було це навмисно?
Нотатки про особистий досвід: Нещодавно я бачила аналіз, в якому точність 4.6 впала з 83,6% до 68,3% на одному з бенчмарків. Це було падіння з 2-го місця до 10-го. Це означає, що 4.6 став гіршим, ніж Sonnet 4.5. Я гадаю, що це може викликати тривогу у багатьох користувачів.
А як щодо десктопного додатку? Болюче питання
Тепер про десктопний додаток. Anthropic його добре рекламував. Розробники стверджували, що самі використовують його замість IDE. Звучить привабливо. Я його випробувала, і там дійсно є багато корисних функцій: зручне керування сесіями, проєктами, контекстне вікно, таймери.
Проте, розробник на ім’я Тео знайшов понад 40 багів лише за годину тестування. Не працювали кнопки, змінювався вигляд, навігація не завжди була інтуїтивно зрозумілою. Це питання до процесу розробки та якості тестування. Можливо, розробники поспішають, щоб якомога швидше запустити продукт.
Акт 3: Вердикт. Чи варто оновлюватися?
Я провела два експерименти, щоб порівняти Opus 4.6 (з використанням “extended”) та Opus 4.7 (без “adaptive thinking”).
Експеримент 1: Фінансовий аналіз.
Я дала обом моделям графік акцій Meta і попросила надати короткий опис з порадами щодо інвестицій.
- Opus 4.6: Його відповідь була більш загальною.
- Opus 4.7: Надав більш детальну інформацію, мав експертний тон, що свідчить про глибоке розуміння фінансової сфери. Він дав більш конкретні і практичні поради. Я оцінила його вище.
Експеримент 2: Допомога стартапу. Я попросила допомогти створити 12-місячну модель для SaaS-бізнесу.
- Opus 4.6 (extended): Створив інтерактивний дашборд, який був наочним та зручним у використанні.
- Opus 4.7: Створив детальний Excel-файл з усіма даними. Хоча у нього були проблеми з математикою, модель швидко виправила помилки.
Мій короткий підсумок з мого досвіду:
- У фінансовому аналізі: Opus 4.7 переміг. Він краще розумів тему і давав глибокі поради.
- У створенні моделей для бізнесу: Я надала б перевагу Opus 4.6 – його легко використовувати. Але Excel-файл від 4.7 теж був корисним, просто іншого формату.
Звісно, за короткий час неможливо повністю оцінити Opus 4.7. Це вимагає часу та роботи у вашому звичайному робочому процесі.
Що далі?
Не знаю, чи було навмисно “погіршено” модель 4.6, але вона дійсно стала гіршою. Щойно випущена 4.7, схоже, є кроком вперед. Варто провести власні тести.
Можливо, Opus 4.7 – це не просто оновлення, а повернення до форми. Можливо, це дозволить виправити ті проблеми, які виникли у Anthropic.
Головне – тестуйте, експериментуйте, і завжди пам’ятайте, що навіть найрозумніший AI – це лише інструмент.
Що ви думаєте? Чи вже встигли спробувати Opus 4.7? Які ваші перші враження? Діліться в коментарях!
Підсумовуючи, можна сказати, що вихід 4.7 став відповіддю на проблеми, з якими стикалися користувачі 4.6. Нові можливості та покращення в 4.7 виглядають перспективно. Щоб зрозуміти, чи ця модель найкраща, потрібно провести власні експерименти та інтегрувати її у ваші власні робочі процеси.
Якщо вам сподобалася ця стаття, поставте лайк! До зустрічі в наступній статті!







