FreeToken是UC Berkeley与MIT等机构联合开源的端侧MoE大模型推理系统。系统通过全层双缓冲、带宽自适应混合调度、Agent状态复用及弹性显存热扩缩容等技术,将个人电脑的CPU、内存、PCIe与GPU统一为弹性计算平台,实现单卡消费级硬件满血运行Qwen3.6-35B、DeepSeek-V4-Flash 284B等超大MoE模型,让本地部署顶尖AI成为现实。

1、端侧满血推理:
支持在RTX 4060/5090等消费级单卡上满血运行Qwen3.6-35B、DeepSeek-V4-Flash 284B等超大MoE模型。
2、全层双缓冲预取:
GPU计算当前层时,后台通过PCIe流式预取下一层Expert权重,彻底消除I/O等待气泡。
3、带宽自适应调度:
实时探测PCIe带宽与CPU算力,动态分流未命中Expert至GPU缓存或CPU就地计算,拉到硬件吞吐极限。
4、Agent状态复用:
在特殊Token边界设置轻量检查点,上下文编辑时仅从最近锚点增量Prefill,避免重复计算完整历史。
5、弹性显存热扩缩:
后台应用抢占显存时,无缝收缩GPU Cache并转交CPU计算,实现0停机、不OOM的平滑降级。
6、极速低延迟:
首Token延迟降低42–58%,Agent多轮交互TTFT减少65–80%,整体比Ollama快2–4倍。
1、打破硬件门槛:
消费级单卡(如RTX 4060/5090)即可满血运行35B–753B参数的超大MoE模型,无需数据中心集群。
2、推理速度领先:
比Ollama快2–4倍,比llama.cpp快1.46倍,笔记本RTX 4060跑Qwen3.6-35B可达39.3 tok/s。
3、首Token延迟极低:
通过全层双缓冲与带宽自适应调度,将长Prompt的TTFT降低42–58%。
4、Agent交互优化:
基于Token边界轻量检查点与状态复用,多轮工具调用场景的TTFT减少65–80%。
5、弹性显存不崩溃:
后台应用抢占显存时,可热扩缩GPU Cache并转交CPU计算,实现0停机、不OOM的平滑降级。
6、全栈异构协同:
将CPU、系统内存、PCIe总线与GPU统一为弹性推理平台,自动收敛至硬件拓扑的理论最大吞吐。
1、桌面App安装:
访问FreeToken官网https://www.flashml.ai/ 下载Windows或Linux桌面App,安装后通过GUI界面即可启动推理服务。
2、命令行快速安装:
通过命令行执行uv pip install "freetoken[accel]" 一键完成CLI工具的安装。
3、模型载入与自动调度:
载入支持的MoE模型权重,系统会自动完成CPU-GPU异构调度与带宽自适应配置。
4、硬件配置建议:
运行DeepSeek-V4-Flash等超大模型时,建议配备32GB显存并搭配192GB以上内存保证稳定流畅。
5、弹性显存自动管理:
使用过程中若后台有游戏或渲染抢占显存,FreeToken会自动热扩缩容,无需手动干预或重启服务。