Simon Willison 回顾 2026 年以来 LLM 的编码智能体、安全事件与本地模型进展
Simon Willison 发布 WeAreDevelopers World Congress North America 闭幕 keynote 的注释版幻灯片和讲稿,按时间线回顾 2026 年以来 LLM 的关键趋势。
Simon Willison 发布 WeAreDevelopers World Congress North America 闭幕 keynote 的注释版幻灯片和讲稿,按时间线回顾 2026 年以来 LLM 的关键趋势。
NVIDIA Isaac ROS 5.0 在 Toronto ROSCon 发布,面向 ROS 机器人开发加入新的 agentic 工作流和平台支持。
推荐理由:文章列出 agentic 工作流、ROS Lyrical 支持和 Jetson 部署路径,便于评估机器人开发链路变化。
Hugging Face 宣布 oMLX 创建者和维护者 Jun Kim 加入团队,以支持 MLX 社区和本地 AI 生态。MLX 是 Apple 面向本地 AI、尤其优化 Apple Silicon 的框架;oMLX 将继续采用 Apache 2.0,Jun 仍将领导该项目。
Hugging Face 发布 @huggingface/kernels,一个用于从 Hugging Face Hub 加载并运行优化 WebGPU kernels 的最小库,同时推出 207 个 WebGPU kernels 和浏览器内 GPU 基准测试套件 Fleet。
推荐理由:文章给出内核打包、加载和基准结果,可帮助开发者评估浏览器本地推理的底层优化路径。
Liquid AI 发布 LFM2.5 系列 3 个模型的 DSpark draft model checkpoints,为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 增加投机解码路径。
Google DeepMind 推出大规模多语言手语转文本翻译模型 SL2T,用于 Pixel 11 上 Gboard 和 Live Transcribe 的手语转文本功能,先支持 ASL 到英语。
推荐理由:原文披露了训练规模、隐私处理和产品入口,可了解手语模型从研究走向手机输入的路径。
Google DeepMind 发布 Gemini Robotics 2,包括 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三个模型,面向机器人全身控制、双手或夹爪灵巧操作和多机器人协作。
推荐理由:原文同时列出云端、端侧和安全评测细节,可用于理解机器人模型从演示走向部署的路径。
Google DeepMind 推出 DiffusionGemma,这是一个实验性开放文本扩散模型,在专用 GPU 上文本生成最高快 4x,用于探索速度敏感的交互式本地工作流。
推荐理由:原文清楚交代了扩散式文本生成的速度收益、硬件条件和质量取舍,便于评估本地交互场景适配度。
Mistral AI 发布 Voxtral Transcribe 2,包括用于批量转写的 Voxtral Mini Transcribe V2 和用于实时应用的 Voxtral Realtime,并在 Mistral Studio 推出音频 playground。
推荐理由:原文同时给出延迟、价格、开源权重和多项基准对比,便于评估语音转写在实时与离线场景的部署取舍。
Mistral AI 发布 Mistral 3,包括 14B、8B、3B 三个小型 dense 模型,以及 41B active、675B total 参数的 MoE 模型 Mistral Large 3,全部以 Apache 2.0 license 发布。
推荐理由:原文同时交代模型规模、开源许可、压缩格式和上线渠道,便于比较前沿与端侧模型的部署取舍。