拖动LOGO到书签栏,立即收藏本站

标签:Transformer

Google TPU十年磨一剑:五代训练超算的进化密码

Google TPU十年磨一剑:五代训练超算的进化密码 从256到9216:一场关于规模的技术长征 说实话,每次看到芯片数量的增长数据,我都会忍不住重新确认一遍——不是...

Transformer 之父转身:Noam Shazeer 终入 OpenAI,一场迟到了三年的 “顶流” 争夺战落幕

Transformer 之父转身:Noam Shazeer 终入 OpenAI,一场迟到了三年的 “顶流” 争夺战落幕 2017年,谷歌的一篇论文标题叫嚣着要把整个AI圈搅个底朝天——《Attent...

当Transformer遇见粒子云:一种理解大模型的全新物理学视角

当Transformer遇见粒子云:一种理解大模型的全新物理学视角 你有没有想过,当你向ChatGPT输入一句话时,那几个简单的文字在模型的“脑海”里究竟经历了什么? ...

当注意力变成奢侈品:MiniMax如何让大模型"选择性失明"

当注意力变成奢侈品:MiniMax如何让大模型'选择性失明' 说实话,每次看到大模型处理超长上下文时那缓慢的输出速度,我都忍不住想——Transformer的核心注意力机...

当AI开始设计下一代AI:DeepMind描绘的超级智能路径图

当AI开始设计下一代AI:DeepMind描绘的超级智能路径图 2024年12月,Google DeepMind悄悄发布了一篇论文,没有盛大的发布会,没有社交媒体上的病毒式传播,但...

VoxCPM:一个让中文大模型训练「降本增效」的开源利器

VoxCPM是清华大学NLP团队(OpenBMB)开源的中文大模型训练框架,专为解决百亿参数模型训练中的显存不足、训练缓慢和成本失控三大痛点而设计。通过PyTorch FSD...