Skip to content
RiverCore
Gemini Omni 1.1 Flash: Розширення сцен до 4K і 40 секунд
Gemini Omni Flashgenerative videoAI video costGemini Omni 1.1 Flash 4K scenesgenerative video cost reduction

Gemini Omni 1.1 Flash: Розширення сцен до 4K і 40 секунд

5 вер 20267 хв. читанняAlex Drover

Кожен, хто запускав генеративний відеоконвеєр у продакшені, знає два числа, які справді мають значення: наскільки довго кліп зберігає зв'язність і скільки коштує один невдалий чернетковий варіант. Новий Gemini Omni 1.1 Flash від Google дає конкретні цифри для обох параметрів: розширення сцен до сукупних 40 секунд і зниження вартості прев'ю до третини від вартості виходу у вищій роздільній здатності. Це і є головна новина. Але цікавіша частина — що це робить з юніт-економікою тих, хто будує продукти поверх цього API.

Цифри

Головна зміна, про яку blog.google повідомив 27 серпня 2026 року, полягає в тому, що Gemini Omni 1.1 Flash може аналізувати до 10 секунд попереднього контексту під час розширення сцени. Попередні моделі враховували лише останню секунду. Це стрибок у 10 разів у вікні, яке модель використовує для збереження зв'язності персонажів, освітлення та руху камери між монтажними склейками. Кожен, хто намагався зшивати генеративні кліпи, знає типовий збій: куртка головного героя змінює колір, джерело світла переміщується, кімната непомітно змінює форму. Більший контекст у проході розширення — це найкорисніший важіль, який Google міг задіяти.

Розширення сцени тепер працює з кроком по 10 секунд до сукупних 40 секунд. Це не повнометражний фільм. Приблизно стільки триває преролова реклама, пояснювальний блок для продукту або вирізка для TikTok. В операційних термінах 40 секунд — це стеля для однієї зв'язної наративної одиниці, після якої вже потрібно передавати матеріал у редакторський софт і монтувати вручну.

Тепер про вартість. 360p-чернетки генеруються на 60% швидше, ніж вивід Omni 1.1 у вищій роздільній здатності, і коштують утричі менше. Для команди, яка спалює сотні ітерацій на день, це суттєво. Якщо ваш творчий цикл раніше коштував $3 000 на тиждень тільки на невдалі чернетки — тепер це близько $1 000. Це не похибка округлення. У команді з 10 людей це різниця між «занесемо у витрати» і «потрібен перегляд бюджету».

Фінальний вивід можна масштабувати до 4K. Інтерполяція першого й останнього кадру тепер є нативним параметром — це уможливлює орбітальні рухи камери, зум-переходи та зациклені кліпи без звичного «боротьби з промптами». Назва моделі в API — gemini-omni-1.1-flash, доступна через Google AI Studio, Gemini Enterprise Agent Platform і Gemini API. Розширення сцени запускається передачею previous_interaction_id відносно попередньої відеовзаємодії. Достатньо просто, щоб досвідчений інженер налаштував це за один день.

Що справді нового

Якщо прибрати маркетинг, три речі справді відрізняються від попереднього циклу.

По-перше, 10-секундне контекстне вікно для розширення сцени. Це реальне архітектурне покращення, а не полірування UX. Орієнтація лише на останній кадр попереднього кліпу — це і є причина, чому генеративне відео нагадувало анімацію типу flip-book із проблемою пам'яті. Десять секунд контексту дозволяють моделі відстежувати вектори руху, позиції другорядних персонажів і безперервність середовища. Інциденти у продакшн-конвеєрах, які я спостерігав, майже завжди зводяться до цієї самої проблеми розривності: модель «забуває», що щойно зробила. Google визнає, що попередній підхід був недостатнім.

По-друге, інтерполяція першого й останнього кадру як повноцінний параметр. Команди, з якими я працював у ad-tech, рік видавали це за допомогою незграбних ланцюжків промптів і трюків із референсними зображеннями. Нативна реалізація — це різниця між п'ятикроковим конвеєром і одним API-викликом. Це скорочує складність коду і, що важливіше, — скорочує поверхню відмов. Кожен цикл повторних спроб, який ви прибираєте, — це нічний пейдж, якого ніколи не буде.

По-третє, багаторівневий робочий процес за роздільною здатністю. 360p для ітерацій, 4K для фіналу. Це та сама схема, яку генерація зображень засвоїла два роки тому і якій відеогенерація вперто чинила опір. Документація Gemini API тепер подає це як просте рішення response_format. Це чітко вписується в те, як творчі команди вже й так працюють: спочатку чорнові варіанти, потім фінал. Модель нарешті поважає робочий процес замість того, щоб вимагати повну оплату — лише щоб з'ясувати, що промпт був хибним.

Що не є новим: стеля базової якості, чутливість до промптів, той факт, що для всього, що демонструється клієнту, все одно потрібна людина в процесі. Моя думка: цей реліз — про те, щоб зробити наявні можливості придатними для використання у продакшн-масштабі, а не про підняття стелі. Це правильне рішення. Стеля була нормальною. Робочий процес був жахливим.

Що вже враховано ринком AI-розробки

Більшість досвідчених інженерів, які будують на генеративному відео, вже очікували три речі. Ринок їх урахував.

4K-масштабування було передбачуваним. Усі провідні відеомоделі натякали на це місяцями, і комп'ютерна економіка нарешті це підтримує. Нікого це не дивує. Багаторівневий чернетковий процес теж був очікуваним: генерація зображень нормалізувала це у 2024 році, і відео завжди мало піти тим самим шляхом. Якщо ви вже не проєктували свій конвеєр за схемою «чернетка — потім фінал», ви будували хибну абстракцію.

Справжній сюрприз — 10-кратний стрибок у контексті розширення. Більшість команд, які я спостерігав, закладали бюджет на 2- або 3-кратне поступове покращення зв'язності протягом наступних 12 місяців. Досягти 10 секунд в одному релізі стискає цю дорожню карту. Якщо ви утримувалися від запуску продукту через те, що генеративне відео «ще не готове для нарративного контенту», цей аргумент щойно послабшав. 40-секундне сукупне обмеження залишається жорсткою стелею, але 40 секунд охоплюють чимало комерційних сценаріїв, які раніше були недоступні.

Інший недооцінений зсув — третина вартості на прев'ю. Команди будували складні обв'язки для кешування та тестування промптів, аби не спалювати бюджет на чернетки. Більша частина тієї інфраструктури тепер стала менш цінною. Незручний висновок: деякі внутрішні інструменти, які ваша ML-платформна команда випустила минулого кварталу, тепер надлишкові. Це хороша проблема, але все одно проблема — бо хтось має вирішити, чи викидати їх, чи залишити працювати.

Контраріанська думка

Консенсусна інтерпретація полягає в тому, що це робить генеративне відео готовим до продакшену. Я б посперечався з таким формулюванням.

Сорок секунд сукупного розширення — це м'яка стеля, яка боляче вдарить у реальних робочих процесах. Будь-який наратив довший за коротку рекламу впирається в цю стіну, і стіна не є предметом переговорів. Не можна розширити понад 40 секунд, заплативши більше. Це означає, що реальний продакшн-сценарій все ще обмежений: прероли, соціальні кліпи, продуктові вирізки, пояснювальні сегменти. Але не серіальний контент, не довготривалий маркетинг, не навчальне відео. Слово «готовий до продакшену» тут несе дуже велике навантаження.

По-друге, «готовий до продакшену» від постачальника моделі і «готовий до продакшену» в розумінні того, що ваш черговий інженер не отримає пейдж посеред ночі — це різні речі. Три міграції, за якими я спостерігав протягом останніх п'яти років, виглядали чисто на стейджингу і розвалювалися в перші вихідні під реальним трафіком. Генеративні відеоконвеєри мають неприємну звичку натикатися на ліміти запитів, несподіванки з квотами і відхилення за контентною політикою саме в найгірший момент. Жодна із нотаток до релізу Omni 1.1 Flash не стосується операційної надійності, семантики повторних спроб чи поведінки в деградованому режимі. Поки ви цього не побачите — сприймайте «готовий до продакшену» як маркетинговий термін.

По-третє, 10-секундне контекстне вікно звучить чудово — доки ви не усвідомлюєте, що воно стосується лише розширення сцени, а не довільних правок. Модель досі не може міркувати про всю вашу 40-секундну послідовність, коли ви просите щось змінити всередині. Це наступна складна проблема, і тут вона не вирішена.

Ключові висновки

  • Переробіть свій цикл чернеток вже сьогодні. Якщо ваш генеративний відеоконвеєр не використовує 360p-прев'ю для ітерацій, ви платите втричі дорожче без жодної причини. Це найвища ROI-зміна з цього релізу.
  • Переоцініть 40-секундну стелю відносно вашої продуктової дорожньої карти. Якщо ваш сценарій вписується в 40 секунд, Omni 1.1 Flash, імовірно, переміщує вас із «прототипу» у «готово до відвантаження». Якщо ні — нічого тут не змінює ваш часовий горизонт.
  • Прибирайте хаки з інтерполяцією першого й останнього кадру через промпти. Нативна інтерполяція тепер є параметром API. Кожен ваш обхідний метод для орбітальних рухів камери та зациклених кліпів є застарілим. Видаліть код, видаліть тести, поверніть собі цикли ревью.
  • Не довіряйте «готовий до продакшену» без власного навантажувального тесту. Прогоніть через API повні вихідні реального трафіку, перш ніж брати зобов'язання щодо клієнтського запуску. Явно інструментуйте повторні спроби, квоти та відхилення за контентною політикою.
  • Закладайте бюджет на стрибок у зв'язності, а не в роздільній здатності. 10-кратне контекстне вікно — це справжня продуктова історія. 4K — це базовий рівень. Якщо ви презентуєте це внутрішньо, починайте з наративної зв'язності, а не з кількості пікселів.

Нудний вердикт: це добротний, корисний реліз, який усуває реальне тертя в наявному робочому процесі. Він не змінює того, що генеративне відео може робити фундаментально. Він змінює те, скільки коштує це з'ясувати. Для більшості команд, які випускають AI-відео в ad-tech, iGaming-промоконтенті або фінтех-поясненнях, цього достатньо, щоб виправдати оновлення конвеєра цього кварталу. Тільки не плутайте кращий API з вирішеною проблемою.

Часті запитання

Q: Що таке Gemini Omni 1.1 Flash і чим він відрізняється від попередньої версії?

Gemini Omni 1.1 Flash — це готова до продакшену генеративна відеомодель від Google, доступна через Google AI Studio, Gemini API і Gemini Enterprise Agent Platform. Головні відмінності від попереднього релізу Omni: 10-секундне вікно попереднього контексту для розширення сцени (замість однієї секунди), нативна інтерполяція першого й останнього кадру, масштабування до 4K і 360p-чернетки, які коштують утричі менше від виводу у вищій роздільній здатності.

Q: Якої максимальної тривалості можуть бути відео, згенеровані за допомогою Gemini Omni 1.1 Flash?

Розширення сцени працює з кроком по 10 секунд до максимально сукупних 40 секунд на послідовність. Це охоплює поширені комерційні сценарії — як-от преролова реклама, продуктові пояснення та короткі соціальні кліпи, — але не підтримує довготривалий наративний контент у рамках однієї зв'язної генерації.

Q: Чи готовий Gemini Omni 1.1 Flash до продакшн-використання в клієнтських застосунках?

Google позиціонує його як готовий до продакшену, і API-інтерфейс достатньо простий для швидкої інтеграції. Разом із тим досвідчені інженери мають провести власні навантажувальні тести, перевірити поведінку при повторних спробах і квотах, а також підтвердити обробку контентної політики під реальним трафіком — перш ніж брати зобов'язання щодо клієнтського запуску. «Готовий до продакшену» від постачальника — це не те саме, що перевірено відповідно до ваших конкретних вимог до надійності.

AD
Alex Drover
RiverCore Analyst · Dublin, Ireland
ПОДІЛИТИСЯ
// СХОЖІ СТАТТІ
ГоловнаРішенняПроєктиПро насКонтакт
Новини06
Дублін, Ірландія · ЄСGMT+1
LinkedIn
🇺🇦UK