跳到正文
10月2日 · 周五

最新精选

9月16日周三
  1. Hugging Face Blog73

    ALTK-Evolve 新增 Consistency Analyzer 和一致性指南生成

    IBM Research 在 ALTK-Evolve 中引入 Consistency Analyzer 和 consistency guidelines,用于衡量并降低 AI 智能体重复执行同一任务时的波动。

    推荐理由:原文把平均准确率与重复成功率分开衡量,为排查智能体生产环境波动提供了可迁移方法。

8月21日周五
  1. Hugging Face Blog69

    Hugging Face 研究如何衡量语音识别中的基准优化

    Hugging Face 的最新研究提出三项测试,用于量化语音识别中的 benchmark optimization 或 benchmaxxing 现象。研究评估了 11 个常用开源 ASR 模型,发现部分高分系统会复现 VoxPopuli English 和 LibriSpeech 的基准转写,即使音频与参考文本矛盾、相关词被静音,或同一音频支持不同书写形式。

    推荐理由:文章用三类探针展示公开语音基准的过拟合迹象,可帮助评估者区分榜单分数与真实转写能力。

6月16日周二
  1. Google DeepMind63

    Google DeepMind 发布 AI Control Roadmap 保障内部 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,用于保护 Google 内部部署的高能力、可能未完全对齐的 AI 智能体。

    推荐理由:原文给出从威胁建模到监控拦截的分层方案,可作为评估企业内部智能体安全治理的参考。

6月8日周一
  1. Google DeepMind74

    Google DeepMind 发布塞拉利昂 Guided Learning 预注册试验结果

    Google DeepMind 的预注册试验显示,塞拉利昂学生使用 Guided Learning 后,数学成绩较对照组提高 +0.258 standard deviations,约相当于 8 周内取得 1.2 到 1.7 年的典型学习进展。

    推荐理由:材料给出塞拉利昂课堂试验的学习增益、使用率和交互数据,可作为评估 AI 辅助教学的案例。

5月16日周六
  1. Google DeepMind65

    Co-Scientist 筛选肝纤维化再利用药物,3 个候选中 2 个阻断纤维化

    Stanford University School of Medicine 的 Gary Peltz 团队在 Advanced Science 发表研究,使用 Co-Scientist 从既有药物文献中寻找可再利用治疗肝纤维化的候选药物。

    推荐理由:材料把 Co-Scientist 的候选药物与人工筛选结果放在同一实验中比较,便于理解其科研辅助价值。

已经到底了