当AI开始”断舍离”:DeepSeek如何用更少内存装下百万token当AI开始"断舍离":DeepSeek如何用更少内存装下百万token 说实话,第一次看到DeepSeek-V4的论文时,我的第一反应是:这群人到底是怎么做到的? 百万token的上下文窗口,这个数字...软件科技# AI模型优化# DeepSeek-V4# DeepSeek技术解读3个月前934
一块4090微调Llama 3?2026年大模型微调工具盘点一块4090微调Llama 3?2026年大模型微调工具盘点 老实说,2024年初我第一次尝试在本地微调Llama 2的时候,光是加载模型就耗尽了我那块24G显存的3090显卡。那时候我觉得,普通开发...软件科技# 4-bit量化# AI模型优化# Llama 3微调3个月前1.1K