Нехай танцює генеративний ШІ: Google запалює, Magnific підкидає дров, а Midjourney готує сюрпризи!

    Привіт, шановні читачі! З вами Ліла Харт, ваш вірний провідник у світі технологій, і я з радістю ділюся з вами новинами, які захоплюють дух. За понад два десятиліття роботи в цій сфері я бачила, як технології змінюються, як з’являються та зникають тренди. Але останні події змусили мене по-справжньому відчути, що ми перебуваємо на порозі нової ери.

    Минулого тижня, поки всі обговорювали нові танцювальні тенденції від BiteDance, технічний світ не стояв на місці – навпаки, було стільки подій, що я ледь встигала їх відстежувати. Тривога навколо “Cance 2.0” відійшла на другий план, поступившись місцем серйозним оновленням від Google. Компанія вирішила вистрілити одразу трьома потужними новинками, від яких у мене ледь не задзвонило у вухах від захвату.

    Ви ж знаєте, як це буває: сидиш, попиваєш каву, перевіряєш новини, і тут – бац! – Google викидає три карти: Gemini 3.1 Pro, Lyria 3 (той самий аудіогенератор!) та абсолютно новий інструмент Photoshoot. Хоча багато хто з вас з нетерпінням чекав на elusive V4, мушу заспокоїти: поки що ні. Але, хто знає, можливо, незабаром з’явиться офіційна дата запуску?

    Але це ще не все! На відео-фронті Magnific нарешті порадував довгоочікуваною функцією – креативним апскейлінгом відео. І якби ви думали, що це все – ні! Ми також отримали перший погляд на Midjourney V8, а також купу інсайтів про їхню майбутню модель.

    Тож, залиште свої танцювальні туфлі, розслабтеся та готуйтеся до справжньої техно-подорожі. Ви це заслужили!


    Розділ 1: Gemini 3.1 Pro – розум, що росте не по днях, а по годинах

    Google останнім часом нарощує темпи, і це вражає. Лише нещодавно я сіла записувати це відео, як вони випустили Gemini 3.1 Pro. Це оновлення слідує за виходом Gemini 3 від DeepMind минулого тижня, і, за словами самих розробників, це крок вперед у “базовому мисленні”. Простіше кажучи, він став розумнішим та отримав потужнішу базу для вирішення складних завдань.

    Звичайно, я не можу пройти повз тему бенчмарків. І хоча я не є експертом у сфері великих мовних моделей (LLMs), це вже майже обов’язковий пункт порядку денного. Google з гордістю демонструє результат у 77,1% ARC-AGI 2. Звучить як наукова формула? Ну, по суті, це тест на абстрактне мислення та здатність навчатися новому “на льоту” з мінімальними прикладами. І ось тут найцікавіше: середній показник людини в цьому тесті – 60-66%. Так-так, Gemini 3.1 Pro обійшов навіть нас!

    Але це ще не все. На моєму улюбленому тесті під назвою “Humanity’s Last Exam” Gemini 3.1 Pro продемонстрував:

    • 44,4% без використання додаткових інструментів;
    • 51,4% з використанням пошуку та коду.

    Це значний стрибок порівняно з Gemini 3 Pro! І що найцікавіше, це майже дзеркальне відображення результатів Claude Opus 4.6 (40% та 53% відповідно).

    Нотатки про особистий досвід. Як людина, що з 2003 року займається бізнес-аналізом та впровадженням ІТ-рішень, я бачу, як ці показники впливають на сучасний світ. Я вважаю, що сьогодні необхідно розуміти не тільки “як це працює”, але й “як це може змінити нашу роботу”. Своїм клієнтам я завжди кажу, що майбутнє – за тими, хто вміє знаходити нові підходи до ведення бізнесу з використанням нових технологій. Немає сенсу боятися цих інструментів, потрібно вчитися управляти ними.

    Цікаво знати: Коли справа доходить до цього “останнього іспиту людства”, я, чесно кажучи, трохи злюся на розумних людей. Вам, розумники, час об’єднуватися, створювати ще розумніших нащадків і вчити їх ставити справді круті запитання! Бо інакше ці штучні інтелекти скоро перевершать нас у всьому.

    Отже, якщо уявити світ найпотужніших моделей як колесо фортуни, то зараз ми знаходимося на дуже високій позначці.

    Де спробувати Gemini 3.1 Pro?

    Зазвичай Google застосовує поетапний запуск. Він вже доступний у додатку Gemini для користувачів тарифних планів Pro та Ultra. Але якщо ви хочете протестувати його швидше, можете зайти до AI Studio. Там є можливість вибрати Gemini 3.1 Pro preview.

    Я вже встигла його протестувати та навіть змусила створити клон гри Missile Command. І знаєте що? Він чудовий! Лише кілька підказок, і ось вам готовий ігровий процес! Що мені найбільше сподобалося, так це те, що він сам запропонував додати звукові ефекти та покращити гру, ніби зазирнув у мою душу розробника.

    "Build me an interactive website based off the channel URL."

    Він не тільки створив сайт, а й запропонував “prompt builder” – це просто неймовірно! Я вражена тим, наскільки він може бути гнучким і креативним.


    Розділ 2: Lyria 3 – музика, що народжується з образів

    А тепер перейдемо до музики! Google також оновив свій генератор музики під назвою Lyria. Наразі він генерує 30-секундні треки, але впевнена, що незабаром з’являться довші версії, з новими можливостями розширення функціоналу.

    Що робить Lyria 3 особливою? Знову-таки, це мультимодальні можливості Gemini 3. Ви можете створювати музику, надихаючись… зображеннями! Такого не робила жодна інша аудіо-модель.

    Процес проходить безпосередньо в Gemini. Ви можете вибирати з готових жанрів або ж самостійно прописувати запит. Ось, наприклад, спробуємо такий сценарій:

    "A man in a blue business suit jaywalking across streets trying to avoid the police who want to give him a jaywalking ticket."

    Я обрала жанр “workout” (хоч і не зовсім розумію його в цьому контексті, але такий зараз тренд! ) і ось що отримала:

    Suit is pressed.
    I’m feeling clean.
    Dodging cops a daily scene.
    See the flashing red and blue.
    Yeah, a ticket? No way I’m coming through.
    Blue suit flashing past the lights.
    Whoa.
    Taking risks and urban flights.
    They can’t catch the hustle, THAT’S THE WORD.
    CAN’T CATCH THE HUSTLE, THAT’S THE WORD.

    Це, звісно, кумедно, але звучить, як справжній хіт кінця 90-х – початку 2000-х! Це такий собі “late 90s, early 2000s banger”. І хоча це лише 30 секунд, це не схоже на повноцінну студію звукозапису. Це швидше веселий та простий спосіб поекспериментувати з генерацією музики.

    Але найцікавіше – це мультимодальний підхід. Я взяла оригінальне зображення “Flamethrower Girl” і просто попросила створити музичний супровід на його основі, не надаючи жодних додаткових інструкцій.

    І ось що вийшло:

    Sun is high and I’m ready to fight.
    Going to set the whole world alive.
    Yeah, I got the gasoline heart.
    Ready to tear it all apart.
    SO WATCH ME START the wildfire.
    My one desire. My one desire.

    Чесно? Я б не обрала рок-гімн в стилі 80-х для “Flamethrower Girl”, але Lyria зчитала образ! Вона зрозуміла, хто зображений, і змогла створити трек, який відповідає атмосфері. Приємно, що навіть 30-секундні треки мають логічне завершення, а не просто обриваються на півслові. Буду уважно стежити за Lyria, відчуваю, що це тільки початок!


    Розділ 3: Photoshoot від Google – ваш особистий фотограф для Маркетплейсу

    А зараз поговоримо про Photoshoot в Google Labs. Ця функція, ймовірно, найбільше зацікавить тих, хто займається брендингом та маркетингом, але я впевнена, що ви знайдете їй безліч інших варіантів застосування.

    Уявіть собі: у вас є щось непотрібне, що ви вирішили продати на Facebook Marketplace. Ви робите фотографію, яка, чесно кажучи… ну, м’яко кажучи, не найкраща. Ось, наприклад, моя флешка, яка валялася на столі:

    [Зображення старої, невиразної флешки]

    Жах, правда? Але ми завантажуємо її в Photoshoot. Далі у вас буде вибір шаблонів для створення фотосесії. Я залишу стандартний, оберу пропорції 9:16 (бо це ж “маркетинг” ) і натисну “Generate”.

    І ось результат:

    [Чотири вражаючі, стильні фото флешки в різних ракурсах, ніби з модного каталогу]

    Я мушу визнати, це просто вражаюче! Враховуючи, яка жахлива була вихідна фотка, це просто диво.

    Але це ще не все. З цих чотирьох зображень Photoshoot може створити цілу рекламну кампанію! Я попросила його згенерувати кампанію для “найкращої USB-флешки у світі”, і за хвилину отримала ось це:

    [Назва згенерованої кампанії: "Onehub zero limits campaign"]

    Це ж прямий шлях на Amazon, чи не так? І, до речі, ви ще й можете анімувати ці зображення.

    Загалом, якщо у вас є щось, що ви хочете продати, але у вас немає гарних фотографій – просто зробіть найгіршу можливу фотографію, завантажте її сюди, і ви побачите, як ваші продажі злетять!

    А що з V4?
    Я знаю, що багато з вас чекають на Veo 4. І хоч я не маю жодної ексклюзивної інформації, моя інтуїція підказує, що його анонсують на Google I/O, яке відбудеться 19 травня. Це головна подія Google, де вони зазвичай роблять свої найгучніші анонси. Це просто логічно – велика сцена, великі новини. Отже, тримаємо кулачки!


    Розділ 4: Magnific – відео, що стає кращим, ніж було

    А тепер перейдімо до того, чого всі так довго чекали – Magnific нарешті випустив функцію креативного апскейлінгу відео. Якщо ви стежите за розвитком подій, то пам’ятаєте, що Magnific був серед перших, хто запропонував подібне для зображень. І ось, нарешті, черга дійшла і до відео.

    Інтерфейс знайомий: завантажуєте свій відеофайл, вибираєте між режимами “natural” (природний) та “vivid” (більш яскравий), налаштовуєте рівень креативності, роздільну здатність (1K, 2K, 4K), чи використовувати преміум-якість (довше, але краще), прискорювати процес (turbo mode), додавати різкість (sharpen) та зернистість (smart grain).

    Нотатки про особистий досвід. Під час моєї роботи в якості консультанта з Digital Transformation я часто стикаюся з питанням покращення якості відео. Тому я постійно шукаю рішення, які допомагають вирішувати проблеми клієнтів. Слід зазначити, що не все так просто, як здається.

    Важливе застереження: Як і у випадку з більшістю подібних інструментів, тут менше – означає краще. Не перестарайтеся з налаштуваннями!

    Я спробувала апскейлити один із моїх попередніх тестів – відео з Cance. І, хоча я не впевнена, як YouTube стискає відео, різниця помітна. Кадри стали плавнішими, загальна якість покращилася.

    [Відео: Порівняння оригінального відео Cance та апскейленого Magnific]

    Це особливо помітно на CGI та анімаційних кадрах. Ось ще один приклад виводу Cance, який Magnific оптимізував:

    [Відео: Ще один приклад апскейлу CGI/анімації]

    Виглядає чудово! Але, як і будь-який креативний апскейлер, Magnific іноді “галюцинує”. Уявіть собі: на відео є стовп диму, а Magnific бачить у ньому… людину на ховерборді!

    [Відео: Приклад "галюцинації" Magnific - стовп диму стає людиною на ховерборді]

    До речі, він навіть не перестав його апскейлити, тож той самий чоловік залишився на ховерборді. Це, до речі, додає певної магії!

    Або інший приклад: червоний символ, де Magnific бачить… обличчя! Так-так, інколи він додає обличчя там, де їх немає. Це, звісно, дивно, але саме в цьому вся сіль! Це як привиди в ШІ – я від цього у захваті!

    [Відео: Приклад "галюцинації" Magnific - обличчя на червоному символі]

    Ще один момент, на який варто звернути увагу, – це “фейс-свопінг”. Ось, наприклад, кліп від Javi з Magnific: Will Smith проти Spaghetti Monster. Спагетті-монстр вийшов просто неймовірним, але обличчя Вілла Сміта… ну, скажімо так, воно дещо змінилося. Хоча, мушу визнати, кліп дуже швидкий, і це може залишитися непоміченим.

    [Відео: Will Smith vs Spaghetti Monster з апскейлом Magnific]

    Але там, де Magnific справді блищить, так це з CG-персонажами. Ось, наприклад, скріншот з трейлера The Witcher 4. Відео було стиснуте, а потім ще й зроблено знімок екрана. Але Magnific чудово його почистив, і навіть з високим рівнем креативності (46%) він залишився досить точним.

    [Відео: Апскейл скріншоту з трейлера The Witcher 4]

    Я також протестувала його на відео з Freepik. Тут складніше, оскільки є різні пресети (анімація, 3D, реалізм тощо). Наприклад, я взяла відео з World Labs (той самий 3D-світ, про який ми говорили раніше, і який нещодавно отримав мільярд доларів інвестицій – агов, це шалено!) та прогнала його через Magnific. Результат, як ви бачите, досить пристойний.

    [Відео: Апскейл відео з World Labs]

    World Labs – чудовий інструмент для створення віртуальних сетів. Берете скріншоти з різних кутів, завантажуєте в Nanobana, додаєте персонажів – і готово!

    Зважаючи на те, що Cance 2, ймовірно, вийде наступного тижня, і його виводи будуть лише 720p, вам точно знадобиться хороший апскейлер в арсеналі. Отож, Magnific – чудовий кандидат на те, щоб додати його до “обраного”.


    Розділ 5: Midjourney V8 – нова глава мистецтва!

    І насамкінець, Midjourney готується до запуску V8, і ми вже маємо попередній погляд та кілька сюрпризів.

    Зараз відбувається “рейтингове паті” для V8. Розробники кажуть, що ці зображення “нудні, ненатхненні, безлюдні” та не відображають повної картини. Але якщо ви користуєтеся Midjourney вже деякий час, то знаєте, що вони так роблять перед великим релізом, щоб налаштувати модель відповідно до побажань спільноти. І це дає нам уявлення про те, чого очікувати.

    Наприклад, текст на зображеннях! Нарешті! Я знаю, це не революція, але це те, чого багато хто з нас так довго чекав.

    Більше того, V8 обіцяє:

    • Краще розуміння промптів.
    • Зв’язність та композицію.
    • Високу швидкість.

    Чесно кажучи, я з нетерпінням чекаю остаточної версії V8. Навіть співробітники Midjourney кажуть, що вони набагато більше вражені запуском V8, ніж V7 (який, зізнаємось, був не бездоганним).

    Серед новинок:

    • Новий редактор. Ймовірно, він буде схожий на сучасні інструменти для обробки зображень.
    • Більш надійна візуальна референція.
    • Новий інтерфейс створення.

    І це ще не все! Цього року очікується нова відео-модель V2, яка буде значно більшою за V1. Враховуючи їхні ресурси, це може бути дуже потужна річ. Отож, Midjourney V8 – це те, що обов’язково варто мати на увазі.

    Коли чекати?

    Midjourney V8 може вийти вже наступного тижня. Але пам’ятайте про “час Midjourney” – вони живуть за власним календарем.


    Підсумок: Що далі?

    Отже, друзі, ми пережили справжній техно-шторм! Gemini 3.1 Pro підняв планку інтелекту, Lyria 3 відкрила нові горизонти для музичної творчості, Photoshoot від Google зробить фотографії товарів видовищними, Magnific покращив відео до невпізнання, а Midjourney обіцяє революцію в мистецтві.

    Що треба пам’ятати:

    • Інтелект ШІ росте експоненційно. Gemini 3.1 Pro вже випереджає середньостатистичну людину в тестах на мислення.
    • Мультимодальність – це майбутнє. Lyria 3 показала, як образи можуть стати джерелом музики.
    • Креативність у ШІ – це не тільки про створення, а й про покращення. Magnific продемонстрував, наскільки можна покращити відео.
    • Штучний інтелект стає доступнішим. Photoshoot зробить професійну фотографію доступною для кожного.
    • Конкуренція стимулює інновації. Google, Magnific, Midjourney – всі вони штовхають одне одного вперед, і ми, користувачі, отримуємо від цього користь.

    Ваше “домашнє завдання”:

    Не бійтеся експериментувати! Спробуйте ці нові інструменти. Напишіть мені в коментарях, як вам Gemini 3.1 Pro, чи вдалося вам створити щось класне за допомогою Lyria 3 та чий апскейлінг відео вам сподобався найбільше.

    Що далі?

    Я вже готуюся до наступного тижня, який обіцяє бути ще більш насиченим. Особливо чекаю на можливий запуск Cance 2.0 (сподіваюся, дата буде 24-те). Тримайте руку на пульсі!

    Дякую, що були зі мною. З повагою, Ліла Харт. До зустрічі!

    Поділитися.
    0 0 голоси
    Рейтинг статті
    Підписатися
    Сповістити про
    guest
    0 Коментарі
    Найстаріші
    Найновіше Найбільше голосів
    0
    Буду рада вашим думкам, прокоментуйте.x