谷歌今日正式在Gemini最新模型中推出“代理视频理解”(agentic video understanding)功能,覆盖Gemini 3.7 Flash、3.6 Flash及3.5 Flash-Lite。该功能让模型不再静态逐帧处理视频,而是主动搜索、扫描关键片段,结合视觉、音频和转录内容进行动态分析。[[1]](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/)
官方基准显示,此举可将token消耗降低高达88%,分析成本减少66%,准确率提升7%。长视频场景(如90分钟讲座或多小时录像)收益尤为显著,开发者无需在高成本与丢帧之间取舍。功能已通过Gemini API在Google AI Studio和企业代理平台上线。[[2]](https://blockchain.news/news/google-gemini-agentic-video-understanding)
Meta 近日以超过 20 亿美元收购中国 AI 初创公司 Manus,旨在强化其在 AI 代理(agent)领域的布局。这一交易发生在全球大厂资本开支高企、代理产品从 demo 转向规模部署的关键节点,直接指向 Meta 在企业级代理能力上的短板。[[1]](https://news.google.com/search?q=AI+news+after:2025-12-29&hl=en-US&gl=US&ceid=US:en)
放眼行业格局,2026 年以来代理赛道已从技术验证进入资本与并购驱动的整合阶段。OpenAI 通过 Assistants API 与企业合作推进,Anthropic 则凭借 Claude 的工具调用与安全框架占据企业信任高地,而 Meta 此前更多依赖自研与 Instagram 等平台生态。Manus 的收购让 Meta 一次性补齐代理执行与多模态交互能力,却也暴露其在前沿模型与代理集成上的追赶压力——与 OpenAI、Anthropic 动辄数百亿美元的算力协议相比,Meta 选择“买”而非“建”。