跳到正文
10月2日 · 周五

最新精选

9月29日周二
  1. AWS Machine Learning Blog73

    Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线

    AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 可用,定位为更智能、更高效的 Sonnet 模型,适合聚焦编码和知识工作。

    推荐理由:原文同时给出 Bedrock 调用方式和适用场景,便于评估 Sonnet 5.5 在 AWS 工作流中的落地成本。

9月3日周四
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,面向智能体工作流、编码推理和网络安全任务。

    推荐理由:原文同时披露通用版与安全版的定价、访问范围和评测结果,便于比较部署取舍。

8月28日周五
8月25日周二
  1. Hugging Face Blog71

    IBM Granite 4.2 推理 LLM 家族发布,含 3B、8B、30B 三种规模

    IBM 发布 Granite 4.2 推理 LLM 家族,包含 3B、8B、30B 三种 dense decoder-only 模型,并以 Apache 2.0 许可证开放。

    推荐理由:文章拆解了 Granite 4.2 从预训练到多阶段 RL 的流程,便于比较开源推理模型的训练取舍。

8月14日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.7 Flash,面向编码和 AI 智能体工作流

    Google DeepMind 发布 Gemini 3.7 Flash,称其是面向编码和 AI 智能体的最智能主力模型,并较 Gemini 3.6 Flash 改进软件工程、知识工作和 Web 开发工作流。

    推荐理由:原文同时给出相对 3.6 Flash 的基准差距与阶段性价格,便于评估编码智能体成本。

8月12日周三
  1. Google DeepMind74

    Google DeepMind 推出 SL2T 手语转文本模型,并接入 Pixel 11

    Google DeepMind 推出大规模多语言手语转文本翻译模型 SL2T,用于 Pixel 11 上 Gboard 和 Live Transcribe 的手语转文本功能,先支持 ASL 到英语。

    推荐理由:原文披露了训练规模、隐私处理和产品入口,可了解手语模型从研究走向手机输入的路径。

8月11日周二
8月10日周一
  1. Hugging Face Blog85

    Meta 发布开源多模态模型 Muse Glimmer-30B,Hugging Face 提供 day-0 支持

    Meta 发布 Muse Glimmer-30B,这是从 Muse 蒸馏到 30B 参数的开源多模态模型,面向本地智能体用例并采用 Apache 2.0 license。

    推荐理由:原文同时给出架构、基准和本地部署示例,便于比较开源多模态模型在本地智能体场景的工程落地路径。

8月6日周四
  1. Google DeepMind82

    Google DeepMind 称 WeatherNext 提升气旋预测约 1 天预警能力并开源模型

    Google DeepMind 表示 WeatherNext AI 模型在 Nature 论文中达到气旋路径、强度和风结构预测的 state-of-the-art 准确率,平均让预报员多获得约 1 天预测准确性。

    推荐理由:原文同时给出 Nature 论文评测、飓风季案例和开源入口,便于理解 AI 天气模型如何辅助预警。

8月4日周二
  1. Mistral AI67

    Mistral AI 发布 Shieldstral 3B 开放权重多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开放权重、策略自适应的多模态安全分类器。它在推理时接受自然语言政策问题,将文本和图像安全评估统一为二元问答任务,无需重训,并输出校准后的安全分数。

    推荐理由:它把内容审核改写为可提问的安全判断,为需要按场景调整策略且不想重训的产品提供参考。

7月30日周四
7月28日周二
  1. Google DeepMind74

    Google DeepMind 发布 Gemini Robotics 2,面向机器人全身控制、灵巧操作与协作

    Google DeepMind 发布 Gemini Robotics 2,包括 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三个模型,面向机器人全身控制、双手或夹爪灵巧操作和多机器人协作。

    推荐理由:原文同时列出云端、端侧和安全评测细节,可用于理解机器人模型从演示走向部署的路径。

7月27日周一
  1. Hugging Face Blog65

    NVIDIA 发布 Cosmos-H-Dreams 实时手术机器人生成式仿真模型

    NVIDIA 推出 Cosmos-H-Dreams,这是面向手术机器人的实时、动作条件生成式仿真模型。它将 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步学生模型,并通过 FlashDreams 提供流式推理,在单张 NVIDIA RTX PRO 6000 上达到交互式运行约 ~160 frames per second。

    推荐理由:原文同时交代蒸馏流程、FlashDreams 推理优化和开放资源,便于理解世界模型如何进入闭环机器人训练。

7月21日周二
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,面向规模化 AI 智能体提供更高 token 效率、更低延迟和更可靠性能。

    推荐理由:原文同时给出价格、token效率和基准差异,便于比较Flash系列在智能体工作流中的取舍。

7月17日周五
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 轻量级网络安全模型

    Google DeepMind 推出 Gemini 3.5 Flash Cyber,这是一款基于 3.5 Flash 微调的轻量级网络安全模型,用于快速查找、验证和修补漏洞。

    推荐理由:原文披露了受限开放方式、基准对比和内部落地案例,可帮助判断安全模型在漏洞修复流程中的应用边界。

7月8日周三
  1. Mistral AI63

    Mistral AI 发布 8B 具身导航模型 Robostral Navigate

    Mistral AI 发布 Robostral Navigate,这是其首个面向具身导航的 8B 模型,可用单个 RGB 摄像头和自然语言指令让机器人在环境中移动。

    推荐理由:原文同时给出传感器配置、基准成绩和训练流程,便于比较具身导航路线的取舍。

6月23日周二
  1. Mistral AI74

    Mistral 发布 Mistral OCR 4,支持边界框、块分类和置信度分数

    Mistral 发布 Mistral OCR 4,文档解析会在提取文本外返回边界框、块类型分类和按页、按词的内联置信度分数。该模型支持 170 种语言、可在单个容器中自托管,并可作为企业搜索、RAG 和特定领域检索管线的摄取组件。

    推荐理由:原文同时给出结构化输出、部署形态和价格,可用于评估文档解析接入RAG与企业搜索的成本。

6月11日周四
  1. Google DeepMind80

    Google DeepMind 发布 DiffusionGemma,文本生成最高快 4x

    Google DeepMind 推出 DiffusionGemma,这是一个实验性开放文本扩散模型,在专用 GPU 上文本生成最高快 4x,用于探索速度敏感的交互式本地工作流。

    推荐理由:原文清楚交代了扩散式文本生成的速度收益、硬件条件和质量取舍,便于评估本地交互场景适配度。

6月9日周二
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.5 Live Translate,支持 70+ 语言实时语音翻译

    Google DeepMind 发布 Gemini 3.5 Live Translate,这是用于实时语音到语音翻译的最新音频模型,可自动检测 70+ 语言并生成自然流畅的译语音频。

    推荐理由:原文同时给出语言覆盖、延迟形态和接入渠道,可用于比较实时语音翻译的产品落地路径。