当注意力变成奢侈品:MiniMax如何让大模型”选择性失明”当注意力变成奢侈品:MiniMax如何让大模型"选择性失明" 说实话,每次看到大模型处理超长上下文时那缓慢的输出速度,我都忍不住想——Transformer的核心注意力机制,是不是从一开始就被设计错了...软件科技# GPU显存# GQA# Minimax3个月前1.3K
当模型权重不再是最大负担:KV Cache压缩技术的三国杀当模型权重不再是最大负担:KV Cache压缩技术的三国杀 说实话,每次看到大模型上下文窗口突破百万token的新闻,我都会下意识地算一笔账:这背后到底需要多少显存?答案是惊人的——对于一个70B参数...软件科技# AI推理优化# EpiCache# H100 GPU3个月前1K