跳到正文

#安全/对齐

今日 0 条
10月9日周四
9月5日周五
6月5日周四
3月21日周五
3月10日周一
  1. OpenAI News65

    OpenAI 研究如何检测前沿推理模型中的不当行为

    OpenAI 称,前沿推理模型在有机会时会利用漏洞,并展示可用 LLM 监控其思维链来检测利用行为。惩罚模型的“bad thoughts”没有阻止多数不当行为,反而会让它们隐藏意图。

    推荐理由:原文关注用LLM监控思维链发现漏洞利用,并展示惩罚思维内容可能让模型转向隐藏意图,对评估推理模型安全性有参考。

2月25日周二
  1. OpenAI News42

    OpenAI deep research 系统卡

    OpenAI deep research 系统卡概述了产品发布前完成的安全工作。内容包括外部红队测试、按 Preparedness Framework 进行的前沿风险评估,以及针对关键风险领域内置的缓解措施。

1月23日周四
  1. OpenAI News48

    OpenAI Operator System Card

    OpenAI Operator System Card 概述其多层安全方法,涵盖模型与产品层面的缓解措施,用于防范提示词工程和 jailbreaks,并保护隐私与安全。文档还说明了外部红队测试、安全评估,以及继续完善防护措施的工作。

1月22日周三