Transformer 之父转身:Noam Shazeer 终入 OpenAI,一场迟到了三年的 “顶流” 争夺战落幕Transformer 之父转身:Noam Shazeer 终入 OpenAI,一场迟到了三年的 “顶流” 争夺战落幕 2017年,谷歌的一篇论文标题叫嚣着要把整个AI圈搅个底朝天——《Attenti...软件科技# AI人才争夺# AI独角兽# AI行业3个月前1.3K
当注意力变成奢侈品:MiniMax如何让大模型”选择性失明”当注意力变成奢侈品:MiniMax如何让大模型"选择性失明" 说实话,每次看到大模型处理超长上下文时那缓慢的输出速度,我都忍不住想——Transformer的核心注意力机制,是不是从一开始就被设计错了...软件科技# GPU显存# GQA# Minimax3个月前1.3K
Google TPU十年磨一剑:五代训练超算的进化密码Google TPU十年磨一剑:五代训练超算的进化密码 从256到9216:一场关于规模的技术长征 说实话,每次看到芯片数量的增长数据,我都会忍不住重新确认一遍——不是因为数据有误,而是因为这个增幅实...软件科技# 3D torus# AI芯片# AI训练超算3个月前1.2K
VoxCPM:一个让中文大模型训练「降本增效」的开源利器VoxCPM是清华大学NLP团队(OpenBMB)开源的中文大模型训练框架,专为解决百亿参数模型训练中的显存不足、训练缓慢和成本失控三大痛点而设计。通过PyTorch FSDP参数分片技术,VoxCP...软件科技# Flash Attention优化# FlashAttention2# FSDP分布式训练3个月前1K
当AI开始设计下一代AI:DeepMind描绘的超级智能路径图当AI开始设计下一代AI:DeepMind描绘的超级智能路径图 2024年12月,Google DeepMind悄悄发布了一篇论文,没有盛大的发布会,没有社交媒体上的病毒式传播,但这篇名为《从通用人工...软件科技# AGI# AI设计AI# ASI3个月前1K
当Transformer遇见粒子云:一种理解大模型的全新物理学视角当Transformer遇见粒子云:一种理解大模型的全新物理学视角 你有没有想过,当你向ChatGPT输入一句话时,那几个简单的文字在模型的“脑海”里究竟经历了什么? 我第一次读到“把Transfor...软件科技# GPT-3# Hopfield神经网络# Query Key Value3个月前883