谷歌今日正式在Gemini最新模型中推出“代理视频理解”(agentic video understanding)功能,覆盖Gemini 3.7 Flash、3.6 Flash及3.5 Flash-Lite。该功能让模型不再静态逐帧处理视频,而是主动搜索、扫描关键片段,结合视觉、音频和转录内容进行动态分析。[[1]](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/)
官方基准显示,此举可将token消耗降低高达88%,分析成本减少66%,准确率提升7%。长视频场景(如90分钟讲座或多小时录像)收益尤为显著,开发者无需在高成本与丢帧之间取舍。功能已通过Gemini API在Google AI Studio和企业代理平台上线。[[2]](https://blockchain.news/news/google-gemini-agentic-video-understanding)