当注意力变成奢侈品:MiniMax如何让大模型”选择性失明”当注意力变成奢侈品:MiniMax如何让大模型"选择性失明" 说实话,每次看到大模型处理超长上下文时那缓慢的输出速度,我都忍不住想——Transformer的核心注意力机制,是不是从一开始就被设计错了...软件科技# GPU显存# GQA# Minimax3个月前1.2K
50%显存削减仅损失3.1%性能:这项研究重新定义了大模型推理的效率边界50%显存削减仅损失3.1%性能:这项研究重新定义了大模型推理的效率边界 大模型推理的显存焦虑,可能即将迎来一个被忽视的解法。 当所有人都在讨论如何通过量化、剪枝来压缩模型体积时,一篇来自工业界的研究...软件科技# GQA# KV cache# MQA3个月前948