NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览提交中给出性能结果
NVIDIA 在 MLPerf Inference v6.1 中提交 Vera Rubin NVL72 预览结果,称其在 Qwen3-VL 上吞吐最高比 GB300 NVL72 高 3.7x,在 DeepSeek-R1 上最高高 2.5x。
NVIDIA 在 MLPerf Inference v6.1 中提交 Vera Rubin NVL72 预览结果,称其在 Qwen3-VL 上吞吐最高比 GB300 NVL72 高 3.7x,在 DeepSeek-R1 上最高高 2.5x。
Hugging Face 的最新研究提出三项测试,用于量化语音识别中的 benchmark optimization 或 benchmaxxing 现象。研究评估了 11 个常用开源 ASR 模型,发现部分高分系统会复现 VoxPopuli English 和 LibriSpeech 的基准转写,即使音频与参考文本矛盾、相关词被静音,或同一音频支持不同书写形式。
推荐理由:文章用三类探针展示公开语音基准的过拟合迹象,可帮助评估者区分榜单分数与真实转写能力。
OpenAI 推出 PaperBench,用于评估 AI 智能体复现最先进 AI 研究的能力。
OpenAI 推出 SWE-Lancer benchmark,用于评估前沿 LLMs 能否通过真实世界自由职业软件工程任务赚取 $1 million。该 benchmark 聚焦软件工程能力与现实任务表现。