当AI学会”作弊”:OpenAI的秘密武器能否终结大模型的测试困局当AI学会"作弊":OpenAI的秘密武器能否终结大模型的测试困局 我一直在思考一个问题:大模型在正式发布之前,到底有多少问题是被"藏着掖着"的?就在今天,OpenAI用一组数据给出了答案——可能比你...软件科技# AI作弊# AI安全# AI安全测试3个月前894
当AI智能体撞上“天花板”:GPT-5.5登顶背后,最难任务0%成功率意味着什么当AI智能体撞上“天花板”:GPT-5.5登顶背后,最难任务0%成功率意味着什么 说实话,看到这条新闻的时候,我愣了好几秒。 OpenAI研究员诺姆·布朗(Noam Brown)在社交平台上宣布:GP...软件科技# 0%成功率# AI天花板# AI智能体3个月前894
微软开源AI评测新利器:一条描述文字,就能生成行为测试微软开源AI评测新利器:一条描述文字,就能生成行为测试 当"调参侠"变成"出题人" 说实话,过去几年我见过太多团队在AI评测这件事上走了弯路。 要么是硬编码一堆断言,结果AI一升级,测试全挂;要么靠人...软件科技# AI开发工具# AI评测框架# AI质量保障3个月前932