O OpinionАналітика та думки про Україну

Gemini тепер сам обирає, які фрагменти відео аналізувати: що це означає

·384 слівредакція
Gemini тепер сам обирає, які фрагменти відео аналізувати: що це означає

Google представила агентний режим аналізу відео для моделей Gemini: штучний інтелект більше не переглядає весь матеріал кадр за кадром, а самостійно визначає найважливіші моменти. Це скорочує витрати на 66% та підвищує точність, відкриваючи нові можливості для роботи з тривалими записами.

Компанія Google запровадила для своїх моделей Gemini 3.7 Flash, 3.6 Flash і 3.5 Flash-Lite функцію агентного аналізу відео. Якщо раніше штучний інтелект обробляв ролики з фіксованою частотою кадрів — за замовчуванням один кадр на секунду, — то тепер він самостійно вирішує, які частини матеріалу потребують детальнішого вивчення. За даними компанії, такий підхід зменшує споживання токенів до 88%, знижує вартість аналізу на 66% і підвищує точність приблизно на 7%.

Агентний режим працює комплексно: модель аналізує візуальні кадри, аудіодоріжку та текстові розшифровки, а потім повторно сканує потрібні фрагменти з вищою частотою кадрів. Це дозволяє знаходити конкретні моменти з точністю до частки секунди, виявляти аномалії, підраховувати об'єкти та відповідати на складні питання щодо багатогодинних записів. Особливо помітні переваги під час роботи з відео від 10-хвилинних інструкцій до 90-хвилинних лекцій.

У тестах LongVideoBench модель Gemini 3.7 Flash з агентним режимом показала найкраще співвідношення точності та вартості серед протестованих аналогів, досягнувши так званої межі Парето — оптимального балансу між якістю результатів і обчислювальними витратами. Для розробників, які працюють із великими відеоархівами, це відкриває нові сценарії: пошук монтажних склейок, миттєвих змін стану, повторний аналіз швидких рухів і точніше відстеження повторюваних дій.

Функція вже доступна через Gemini API в Google AI Studio та Gemini Enterprise Agent Platform. Вона підтримує як завантажені відео, так і ролики з YouTube, а активація потребує лише встановлення режиму обробки agentic у конфігурації API. Додаткова плата не стягується — використовуються стандартні тарифи. Найближчим часом технологія стане доступною всім користувачам застосунку Gemini, а в наступні місяці з'явиться у функції Ask YouTube, яка враховуватиме не лише субтитри, а й візуальний зміст відео.

Цей крок Google продовжує серію оновлень у сфері мультимодального ШІ. Раніше компанія представила Gemini 3.5 Transcribe — модель для розпізнавання мовлення в реальному часі з підтримкою понад 85 мов, яка очищає текст від слів-паразитів і розділяє голоси співрозмовників. Агентний аналіз відео — ще один крок до того, щоб ШІ працював ефективніше з великими обсягами даних, зосереджуючись на суті, а не на механічному перегляді всього підряд.

Читайте також