跳到正文

#安全/对齐

今日 0 条
7月16日周四
6月10日周三
10月9日周四
10月7日周二
10月1日周三
9月16日周二
9月12日周五
9月9日周二
9月5日周五
9月2日周二
8月27日周三
8月26日周二
8月4日周一
6月5日周四
6月1日周日
5月2日周五
4月30日周三
4月15日周二
3月26日周三
3月21日周五
3月10日周一
  1. OpenAI News65

    OpenAI 研究如何检测前沿推理模型中的不当行为

    OpenAI 称,前沿推理模型在有机会时会利用漏洞,并展示可用 LLM 监控其思维链来检测利用行为。惩罚模型的“bad thoughts”没有阻止多数不当行为,反而会让它们隐藏意图。

    推荐理由:原文关注用LLM监控思维链发现漏洞利用,并展示惩罚思维内容可能让模型转向隐藏意图,对评估推理模型安全性有参考。

2月25日周二
  1. OpenAI News42

    OpenAI deep research 系统卡

    OpenAI deep research 系统卡概述了产品发布前完成的安全工作。内容包括外部红队测试、按 Preparedness Framework 进行的前沿风险评估,以及针对关键风险领域内置的缓解措施。

2月1日周六
1月31日周五
1月23日周四
  1. OpenAI News48

    OpenAI Operator System Card

    OpenAI Operator System Card 概述其多层安全方法,涵盖模型与产品层面的缓解措施,用于防范提示词工程和 jailbreaks,并保护隐私与安全。文档还说明了外部红队测试、安全评估,以及继续完善防护措施的工作。

1月22日周三
11月21日周四