AI数学王座争夺战:Claude Fable 5如何在一夜之间改写游戏规则AI数学王座争夺战:Claude Fable 5如何在一夜之间改写游戏规则 说实话,当我看到Claude Fable 5在FrontierMath最难层级拿下88%准确率这个数字时,我的第一反应是反复...软件科技# AI推理能力# AI数学推理# Anthropic2个月前952
ChatGPT不再是AI代名词:市场份额从76%跌至54%,问题不在质量ChatGPT不再是AI代名词:市场份额从76%跌至54%,问题不在质量 当一个产品名字成为整个品类的代名词,它还需要担心竞争吗? 2022年底,ChatGPT用了5天时间吸引了100万用户,创造了互...软件科技# AI市场份额# AI生态# AI竞争2个月前947
马斯克的AI野心撞上了现实:xAI被曝用Claude训练模型,团队却在分崩离析马斯克的AI野心撞上了现实:xAI被曝用Claude训练模型,团队却在分崩离析 说实话,当我第一次看到这则消息时,我的第一反应是:这未免太戏剧性了。但仔细想想,这或许是AI行业当前竞争格局最真实的写照...软件科技# AI竞争# AI训练# API断供3个月前937
Altman口中的”主动AI”:AI的下一步,不是等你开口Altman口中的"主动AI":AI的下一步,不是等你开口 你有没有过这种感觉——AI明明很强大,但你就是不知道该问它什么?我采访过几十家企业,这个问题出现的频率高得惊人。员工们面对一个空白的输入框...软件科技# AI Agent# AI交互模式# AI代理3个月前928
当AI遇见虚假信息:爱沙尼亚团队的这项测试,让所有人脊背发凉当AI遇见虚假信息:爱沙尼亚团队的这项测试,让所有人脊背发凉 你信不信,一款AI助手在0.3秒内就能把一段精心编织的俄罗斯官方叙事,“翻译”成听起来客观中立、甚至带有同情色彩的新闻稿? 这不是假设,而...软件科技# AI安全# RLHF# 事实核查2个月前921
当Siri装上了Gemini的大脑:苹果AI战略的得与失当Siri装上了Gemini的大脑:苹果AI战略的得与失 上周苹果在全球开发者大会上宣布,Siri的全面升级将依托Google的Gemini大模型实现。消息一出,科技圈炸开了锅。这不是一次普通的合作...软件科技# AI合作# AI基础设施# AI护城河3个月前907
AI说话到底有没有意义?这个问题比你想的复杂得多AI说话到底有没有意义?这个问题比你想的复杂得多 当Claude回答"马德里是西班牙的首都"时,这句话到底算什么意思? 表面上看,这似乎是个荒谬的问题。问题清晰,答案准确,我们每个人都秒懂了这句话。但...软件科技# AI幻觉# AI意识# AI语言意义3个月前904
微软的“脱欧”时刻:13亿美元砸出的盟友,如今为何成了竞争对手?微软的“脱欧”时刻:13亿美元砸出的盟友,如今为何成了竞争对手? 2024年,当科技圈还在热议OpenAI估值飙升至860亿美元、ChatGPT月活用户突破1亿的时候,一条不那么起眼的消息淹没在了信息...软件科技# AI产业# AI投资# Azure云3个月前894
当通用AI开始”跨界”:医学评估赛道的意外颠覆当通用AI开始"跨界":医学评估赛道的意外颠覆 你可能还记得,当ChatGPT在2022年末横空出世时,医学界的第一反应是审慎的观望——它能写病历吗?能辅助诊断吗?会不会胡说八道害死人?三年后的今天...软件科技# AI医疗# ChatGPT# Claude3个月前893
我眼睁睁看着我的AI Agent在工具调用中途编瞎话——这比普通幻觉恐怖多了我眼睁睁看着我的AI Agent在工具调用中途编瞎话——这比普通幻觉恐怖多了 凌晨两点,我对着屏幕愣了足足三十秒。 事情的经过是这样的:我在测试一个基于大语言模型的智能体(Agent),给它发了一条再...软件科技# Agent架构# AI Agent# API响应3个月前884
当“更多计算”不再是答案:LoopCoder-v2重新定义测试时计算当“更多计算”不再是答案:LoopCoder-v2重新定义测试时计算 在AI领域,有一个近乎被奉为圭臬的信念:模型的输出质量与它投入的推理成本成正比。无论是OpenAI的o系列、Anthropic的C...软件科技# 7B参数模型# AI推理优化# LoopCoder-v22个月前872
当AI Agent拿起命令行:一段关于隔离与风险的实验之旅当AI Agent拿起命令行:一段关于隔离与风险的实验之旅 "给大语言模型一个BashShell,就像把喷火器交给幼儿园小朋友——毫无用处,但令人胆战心惊。" 半年前,我在某个AI工程社区看到这句话时...软件科技# AI Agent# Bash Shell# Prompt injection3个月前872