Gemini тепер сам обирає, які фрагменти відео аналізувати: що це означає

Google представила агентний режим аналізу відео для моделей Gemini: штучний інтелект більше не переглядає весь матеріал кадр за кадром, а самостійно визначає найважливіші моменти. Це скорочує витрати на 66% та підвищує точність, відкриваючи нові можливості для роботи з тривалими записами.
Компанія Google запровадила для своїх моделей Gemini 3.7 Flash, 3.6 Flash і 3.5 Flash-Lite функцію агентного аналізу відео. Якщо раніше штучний інтелект обробляв ролики з фіксованою частотою кадрів — за замовчуванням один кадр на секунду, — то тепер він самостійно вирішує, які частини матеріалу потребують детальнішого вивчення. За даними компанії, такий підхід зменшує споживання токенів до 88%, знижує вартість аналізу на 66% і підвищує точність приблизно на 7%.
Агентний режим працює комплексно: модель аналізує візуальні кадри, аудіодоріжку та текстові розшифровки, а потім повторно сканує потрібні фрагменти з вищою частотою кадрів. Це дозволяє знаходити конкретні моменти з точністю до частки секунди, виявляти аномалії, підраховувати об'єкти та відповідати на складні питання щодо багатогодинних записів. Особливо помітні переваги під час роботи з відео від 10-хвилинних інструкцій до 90-хвилинних лекцій.
У тестах LongVideoBench модель Gemini 3.7 Flash з агентним режимом показала найкраще співвідношення точності та вартості серед протестованих аналогів, досягнувши так званої межі Парето — оптимального балансу між якістю результатів і обчислювальними витратами. Для розробників, які працюють із великими відеоархівами, це відкриває нові сценарії: пошук монтажних склейок, миттєвих змін стану, повторний аналіз швидких рухів і точніше відстеження повторюваних дій.
Функція вже доступна через Gemini API в Google AI Studio та Gemini Enterprise Agent Platform. Вона підтримує як завантажені відео, так і ролики з YouTube, а активація потребує лише встановлення режиму обробки agentic у конфігурації API. Додаткова плата не стягується — використовуються стандартні тарифи. Найближчим часом технологія стане доступною всім користувачам застосунку Gemini, а в наступні місяці з'явиться у функції Ask YouTube, яка враховуватиме не лише субтитри, а й візуальний зміст відео.
Цей крок Google продовжує серію оновлень у сфері мультимодального ШІ. Раніше компанія представила Gemini 3.5 Transcribe — модель для розпізнавання мовлення в реальному часі з підтримкою понад 85 мов, яка очищає текст від слів-паразитів і розділяє голоси співрозмовників. Агентний аналіз відео — ще один крок до того, щоб ШІ працював ефективніше з великими обсягами даних, зосереджуючись на суті, а не на механічному перегляді всього підряд.
Читайте також
Ще в розділі «Технології»
- ШІ зруйнує економіку: прогноз експерта, який передбачив кризи
- Ціни на пальне у вересні: коли водії побачать знижки на АЗС
- Магнітні бурі 20 вересня 2026 року: чому день буде спокійним
- Бездротова зарядка: зручність, яка нагріває смартфон і гаманець
- Магнітна буря 10 вересня: пік активності припав на ніч, далі поле заспокоїться







