Google DeepMind 在 Gemini 中推出智能体视频理解功能
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中推出智能体视频理解功能,用于提升视频分析准确性并降低 token 用量和成本。
推荐理由:原文同时给出成本、token 与质量变化,以及 API 开启方式,便于评估长视频分析工作流。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中推出智能体视频理解功能,用于提升视频分析准确性并降低 token 用量和成本。
推荐理由:原文同时给出成本、token 与质量变化,以及 API 开启方式,便于评估长视频分析工作流。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API in Google AI Studio 为开发者提供更可控的生成式视频能力。
推荐理由:原文列出场景延展、关键帧插值和4K升级等接口细节,便于评估视频生成工作流接入方式。
Gradio 的 gr.Workflow 将 AI 应用管线描述为类型化节点图,并提供拖拽画布,让每个节点可运行、中间结果可见。同一图也会成为 REST API,并可一条命令部署到 Hugging Face Spaces。
推荐理由:原文展示了 gr.Workflow 如何把多步 AI 管线做成可运行画布和 REST API,便于复用到 Gradio 应用。
NVIDIA 推出 Cosmos-H-Dreams,这是面向手术机器人的实时、动作条件生成式仿真模型。它将 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步学生模型,并通过 FlashDreams 提供流式推理,在单张 NVIDIA RTX PRO 6000 上达到交互式运行约 ~160 frames per second。
推荐理由:原文同时交代蒸馏流程、FlashDreams 推理优化和开放资源,便于理解世界模型如何进入闭环机器人训练。
OpenAI 介绍了 Sora 2,这是一款支持同步对白和音效的视频生成模型。材料同时说明,Sora 产品已不再可用。
推荐理由:原文只给出同步对白、音效和产品不可用信息,适合把握 Sora 2 发布的基本边界。
OpenAI 发布 Sora 2 System Card,称 Sora 2 是新的 SOTA 视频和音频生成模型。该模型基于 Sora,引入更准确的物理、更清晰的真实感、同步音频、增强可控性和扩展的风格范围。
推荐理由:原文概括了 Sora 2 相比前代在物理、真实感、同步音频和可控性上的变化。
Invideo AI 使用 OpenAI 的 GPT-4.1、gpt-image-1 和 text-to-speech 模型,将创意在数分钟内转成专业视频,视频创建速度提升 10x。
OpenAI 的视频生成模型 Sora 现已可在 sora.com 使用,用户可生成最高 1080p、最长 20 sec 的视频。Sora 支持宽屏、竖屏或方形画幅,可使用自有素材进行扩展、remix 和 blend,也可从文本生成全新内容。
推荐理由:原文给出 Sora 的开放入口、分辨率、时长和画幅信息,可帮助视频生成用户评估适用场景。
跨学科艺术家 Minne Atairu 分享了 Sora 如何帮助她实现创作愿景,重点呈现这一工具在艺术表达与构思落地中的作用。
电影制作组合 Vallée Duhamel 讲述 Sora 如何帮助构建新世界。
电影制作人 Lyndon Barrois 讲述如何将 Sora 用作叙事工具,借助它为动画创作构建新的世界与故事表达。