AI Agent的“期末考试”来了,这次谁才是真学霸?AI Agent的“期末考试”来了,这次谁才是真学霸? 说实话,每次看到AI基准测试发布,我都有种看学霸们同台竞技的既视感。但今天这个AA-Briefcase,确实让我眼前一亮——它测的不是模型会不会...软件科技# AA-Briefcase# Agent能力# AI Agent3个月前1.6K
当AI学会”作弊”:OpenAI的秘密武器能否终结大模型的测试困局当AI学会"作弊":OpenAI的秘密武器能否终结大模型的测试困局 我一直在思考一个问题:大模型在正式发布之前,到底有多少问题是被"藏着掖着"的?就在今天,OpenAI用一组数据给出了答案——可能比你...软件科技# AI作弊# AI安全# AI安全测试3个月前985
Claude Fable 5背后的秘密:Anthropic承认“错误的权衡”,以及仍悬而未决的争议Claude Fable 5背后的秘密:Anthropic承认“错误的权衡”,以及仍悬而未决的争议 说实话,每次看到AI公司卷入金拱门(译注:指大厂之间的竞争纠纷)的时候,我都会有一种复杂的感受。一方...软件科技# AI公司竞争# AI安全研究# AI模型公信力3个月前1.2K