强大单卡技术助力AI模型免费下载,开启Token新时代!
本周五,AI领域内的一个突破性进展引发了热烈的探讨,这一技术使得个人电脑也能够高效运行大型深度学习模型。例如,一台配备RTX 4060的笔记本电脑可以流畅运行Qwen 3.6-35B模型,而搭载RTX 5090的桌面计算机则能顺利处理DeepSeek-V4-Flash 284B模型,并且所有测试均为单卡运行,性能未受影响。这项技术的推出,使得Codex在处理中位解码的速度高达33 token/s,而RTX 4060实现的39.3 token/s更是超越了这一标准。由来自加州大学伯克利分校和麻省理工学院等知名学府的研究团队发布的FreeToken,这一全新的开源边缘端推理系统已经投入使用。两位主要作者杨硕和范晓泽分别为伯克利EECS的博士生和德克萨斯大学奥斯汀分校的研究生,他们都在先前于上海交通大学获取学士学位。此团队还包括多位顶尖学者,如Ion Stoica、Matei Zaharia、Kurt Keutzer和韩松等。
FreeToken系统专门针对混合专家(MoE)模型在消费级硬件上进行的本地部署进行了全面优化,打破了以前需要依赖数据中心集群这一硬件瓶颈。相关论文《FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution》现已公开,感兴趣的人员可以在GitHub上找到该项目。FreeToken的桌面应用现已支持Windows和Linux,用户可以通过简单的命令快速安装。
那么,消费级硬件究竟能支持何种性能呢?传统上,CPU-GPU的权重卸载方案由于受限于PCIe带宽,导致推理速度缓慢,甚至会产生卡顿。而FreeToken的推出,使得本地推理达到了"互动级实用速度"。此外,FreeToken在处理长上下文内容时,避免了传统卸载方案中由于逐层调用系统内存而造成的I/O瓶颈,将首次Token延迟降低了42-58%。特别是在与当今流行的Agent工具(如Claude Code和OpenClaw)进行交互时,FreeToken的引入极大地优化了多轮交互的响应速度,减少了65-80%的延迟。
论文还对不同的PCIe规格及多种CPU进行了性能测试,证明在同时执行高I/O任务情况下,FreeToken算法能够自动调整计算分配,灵活应对带宽受限的环境。在高负载场景下,例如3D渲染或者游戏占用显存导致可用显存骤降时,传统方案往往会导致CUDA内存溢出崩溃,而FreeToken则能无缝调整GPU缓存大小,将未命中的Expert转移到CPU上处理,保证推理服务的连续性和平稳性。
如今,利用这个新技术,我们无需再为了模型达到100%显存占用而感到压力。对于稀疏激活的MoE结构,充分利用PC上常见的DDR5大容量内存与PCIe高带宽通道,结合消费级显卡,即可实现高效的个人使用体验。显然,这一技术的发展意味着在内存不足时,也能以其他方式补充系统资源。在运行DeepSeek V4 Flash这样的模型时,尽管其专家池容量大约为140GB,但只需32GB的显存和理想状态下192GB的内存便可稳定运行。
FreeToken的成功,解决了当下大模型的开放权重问题,过去模型获取难,但现今用户仍然面临着能否顺利运行模型的挑战。随着能力的提升,尽管大模型速度接近第一梯队,开放性却依然挂钩于数据中心的局限。而在Steam游戏平台的统计中,约72%的玩家电脑配备了NVIDIA显卡,其中最受欢迎的是RTX 4060笔记本显示卡。如果能够充分用好这些资源,将为更多用户开启使用大型模型的可能性。
樊振东带队获胜 德甲首秀表现精彩
针对不同年龄和技能水平的篮球教学课程,包括儿童篮球、成人初学者、技巧提升等。...
今日CCTV5精彩直播多项体育赛事,丁俊晖全网出战
针对不同年龄和技能水平的篮球教学课程,包括儿童篮球、成人初学者、技巧提升等。...