Condé Nast 如何用 Amazon Bedrock 构建多模态视频发现系统
Condé Nast 与 AWS Generative AI Innovation Center 基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建了多模态视频发现方案,用意图式语义搜索替代仅依赖元数据的检索。
Condé Nast 与 AWS Generative AI Innovation Center 基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建了多模态视频发现方案,用意图式语义搜索替代仅依赖元数据的检索。
AWS 教程演示在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 AWS vLLM-Omni DLC 实现文本输入和音频输出的实时流式语音应用。
NVIDIA 在 9月22-23日的 AI Day Singapore 展示其与合作伙伴在东南亚推进 AI 从试点到生产的进展。
H Company 发布 NeoMME,一组 260M 和 800M 多语言多模态编码器,已在 Hugging Face Transformers 提供并以 Apache 2.0 许可发布检查点。
推荐理由:文章同时给出架构、ViDoRe 结果和索引压缩方案,可作为视觉文档检索选型参考。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中推出智能体视频理解功能,用于提升视频分析准确性并降低 token 用量和成本。
推荐理由:原文同时给出成本、token 与质量变化,以及 API 开启方式,便于评估长视频分析工作流。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API in Google AI Studio 为开发者提供更可控的生成式视频能力。
推荐理由:原文列出场景延展、关键帧插值和4K升级等接口细节,便于评估视频生成工作流接入方式。
Gradio 的 gr.Workflow 将 AI 应用管线描述为类型化节点图,并提供拖拽画布,让每个节点可运行、中间结果可见。同一图也会成为 REST API,并可一条命令部署到 Hugging Face Spaces。
推荐理由:原文展示了 gr.Workflow 如何把多步 AI 管线做成可运行画布和 REST API,便于复用到 Gradio 应用。
Google DeepMind 推出大规模多语言手语转文本翻译模型 SL2T,用于 Pixel 11 上 Gboard 和 Live Transcribe 的手语转文本功能,先支持 ASL 到英语。
推荐理由:原文披露了训练规模、隐私处理和产品入口,可了解手语模型从研究走向手机输入的路径。
Microsoft Research 介绍 CARE-X,这是一个面向胸部 X 光多任务解读的统一放射学 VLM 研究模型,可生成报告、做结构化预测并给出可调阈值的置信分数。
Meta 发布 Muse Glimmer-30B,这是从 Muse 蒸馏到 30B 参数的开源多模态模型,面向本地智能体用例并采用 Apache 2.0 license。
推荐理由:原文同时给出架构、基准和本地部署示例,便于比较开源多模态模型在本地智能体场景的工程落地路径。
Mistral AI 发布 Shieldstral,一个 3B 开放权重、策略自适应的多模态安全分类器。它在推理时接受自然语言政策问题,将文本和图像安全评估统一为二元问答任务,无需重训,并输出校准后的安全分数。
推荐理由:它把内容审核改写为可提问的安全判断,为需要按场景调整策略且不想重训的产品提供参考。
Google DeepMind 发布 Gemini Robotics ER 2,称其为面向机器人的最强“具身推理”模型,用于视频理解、任务编排和多机器人协作。
推荐理由:原文同时给出开放入口、机器人协作示例和安全评测维度,便于理解具身模型在真实任务中的落地路径。
Google DeepMind 发布 Gemini Robotics 2,包括 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三个模型,面向机器人全身控制、双手或夹爪灵巧操作和多机器人协作。
推荐理由:原文同时列出云端、端侧和安全评测细节,可用于理解机器人模型从演示走向部署的路径。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,面向规模化 AI 智能体提供更高 token 效率、更低延迟和更可靠性能。
推荐理由:原文同时给出价格、token效率和基准差异,便于比较Flash系列在智能体工作流中的取舍。
Mistral AI 发布 Robostral Navigate,这是其首个面向具身导航的 8B 模型,可用单个 RGB 摄像头和自然语言指令让机器人在环境中移动。
推荐理由:原文同时给出传感器配置、基准成绩和训练流程,便于比较具身导航路线的取舍。
Mistral 在 AI Now Summit 2026 公布面向企业和政府的 full-stack AI 方案,包括 Mistral for Industrial Engineering、Vibe 更新和 Les Ulis data center。
Google DeepMind 正在为 Project Genie 推出由 Street View 支持的真实地点锚定能力,并向全球符合条件的 Google AI Ultra $200 订阅用户逐步开放。
推荐理由:原文说明 Project Genie 如何用 Street View 锚定真实地点,可作为观察世界模型产品化路径的案例。
Google 正在扩展 Search、Gemini、Chrome、Pixel 和 Cloud 中的内容透明度与验证工具,并推出 AI Content Detection API。
推荐理由:原文梳理了 SynthID、C2PA 与检测 API 的扩展路径,可用于理解内容溯源工具的落地方式。
Mistral AI 推出 Forge,帮助企业用专有知识训练面向内部流程的 AI 模型。Forge 支持预训练、后训练、强化学习、dense 与 MoE 架构,以及按需处理多模态输入。Mistral Vibe 等智能体可用它微调模型、寻找超参数、调度任务并生成合成数据。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一次主要版本,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到一个模型中。
推荐理由:原文列出架构、上下文和部署入口,可比较开放 MoE 模型在推理与多模态任务中的取舍。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,并与 NVIDIA 计划共同开发前沿开源 AI 模型。Mistral AI 将贡献专有训练技术、多模态能力和企业级微调工具,同时利用 NVIDIA 的计算资源、模型开发工具和合成数据生成流水线;文中还提到 Mistral AI 今天发布 Mistral Small 4。
Mistral AI 发布 Mistral 3,包括 14B、8B、3B 三个小型 dense 模型,以及 41B active、675B total 参数的 MoE 模型 Mistral Large 3,全部以 Apache 2.0 license 发布。
推荐理由:原文同时交代模型规模、开源许可、压缩格式和上线渠道,便于比较前沿与端侧模型的部署取舍。
OpenAI 介绍了 Sora 2,这是一款支持同步对白和音效的视频生成模型。材料同时说明,Sora 产品已不再可用。
推荐理由:原文只给出同步对白、音效和产品不可用信息,适合把握 Sora 2 发布的基本边界。
OpenAI 发布 Sora 2 System Card,称 Sora 2 是新的 SOTA 视频和音频生成模型。该模型基于 Sora,引入更准确的物理、更清晰的真实感、同步音频、增强可控性和扩展的风格范围。
推荐理由:原文概括了 Sora 2 相比前代在物理、真实感、同步音频和可控性上的变化。
SchoolAI 使用 GPT-4.1、图像生成和 TTS,为超过 100 万间教室提供安全、由教师引导的 AI 工具。该平台用于提升学生参与度、教师监督能力和个性化学习体验。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API。新增 API 能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:原文同时列出语音模型和 Realtime API 能力变化,可用于把握实时语音交互接口的更新方向。
OpenAI 推出 GPT-5,称其为迄今最好的 AI 系统。OpenAI 表示,GPT-5 相比其以往所有模型在智能上有显著提升,在编码、数学、写作、健康、视觉感知等方面具备先进性能。
推荐理由:原文列出 GPT-5 相比既有模型的覆盖领域,便于快速把握 OpenAI 对本代模型的定位。
Invideo AI 使用 OpenAI 的 GPT-4.1、gpt-image-1 和 text-to-speech 模型,将创意在数分钟内转成专业视频,视频创建速度提升 10x。
OpenAI o3 和 o4-mini System Card 称,两款模型结合了 state-of-the-art 推理与完整工具能力。材料列出的工具包括 web browsing、Python、图像和文件分析、图像生成、canvas、automations、file search 和 memory。
推荐理由:材料列出 o3 与 o4-mini 的推理和工具能力范围,便于了解官方对模型定位的表述。
OpenAI 在 2025 launch 中为 GPT‑4o 引入原生图像生成,包括更强的文本渲染和指令跟随能力。原文还提到可探索 ChatGPT Images 2.5。
推荐理由:原文概括了 GPT‑4o 图像生成的能力重点,可作为了解文本渲染和指令跟随改进的入口。
Hugging Face Blog 介绍 IDEFICS,这是一个对 SOTA 视觉语言模型的开放复现项目。材料抓取失败,仅标题可用。