ai本地模型加速器
本地运行 AI 模型,像ollama,LMstudio等 都是多模型适配的。下面这几个做了独立优化
目前网信息比较多的加速器有3个,dflash FreeToken和TensorRT-LLM 仅支持少量模型,有多有少,自行查询
1. dflash
https://github.com/z-lab/dflash
支持模型有:
模型系列 目标模型 DFlash 草稿模型
Qwen (通义千问) Qwen3.6-27B z-lab/Qwen3.6-27B-DFlash
Qwen3.6-35B-A3B z-lab/Qwen3.6-35B-A3B-DFlash
Qwen3.5-4B z-lab/Qwen3.5-4B-DFlash
Qwen3.5-9B z-lab/Qwen3.5-9B-DFlash
Qwen3.5-27B z-lab/Qwen3.5-27B-DFlash
Qwen3.5-35B-A3B z-lab/Qwen3.5-35B-A3B-DFlash
Qwen3.5-122B-A10B z-lab/Qwen3.5-122B-A10B-DFlash
Qwen3.5-397B-A17B z-lab/Qwen3.5-397B-A17B-DFlash
Qwen3-4B (非思考模式) z-lab/Qwen3-4B-DFlash-b16
Qwen3-8B (非思考模式) z-lab/Qwen3-8B-DFlash-b16
Qwen3-Coder-Next z-lab/Qwen3-Coder-Next-DFlash
Qwen3-30B-A3B-Coder z-lab/Qwen3-30B-A3B-Coder-DFlash
Gemma gemma-4-26B-A4B-it z-lab/gemma-4-26B-A4B-it-DFlash
gemma-4-31B-it z-lab/gemma-4-31B-it-DFlash
GPT-OSS gpt-oss-20b z-lab/gpt-oss-20b-DFlash
gpt-oss-120b z-lab/gpt-oss-120b-DFlash
MiniMax MiniMax-M2.5 z-lab/MiniMax-M2.5-DFlash
MiniMax-M2.7 z-lab/MiniMax-M2.7-DFlash
Kimi (月之暗面) Kimi-K2.5 z-lab/Kimi-K2.5-DFlash
Llama Llama-3.1-8B-Instruct z-lab/LLaMA3.1-8B-Instruct-DFlash-UltraChat
GLM GLM-5.1 即将推出
DeepSeek DeepSeek-V4-Flash / Pro 即将推出
2. FreeToken ,不支持mac os
https://github.com/FlashML-org/FreeToken
https://www.flashml.ai/
支持模型
模型系列 代表模型 关键特征
DeepSeek DeepSeek-V4-Flash (284B) 可在 32GB 显存的游戏台式机上以交互速度运行 (22-25 token/s)
Qwen (通义千问) Qwen3.6-35B-A3B (35B) 可在 8GB 显存的笔记本上达到 39.3 token/s 的推理速度
GLM (智谱) GLM-5.2 (753B) 可在单张 96GB 显存的工作站显卡上成功运行
3 TensorRT-LLM - 仅支持英伟达运行AI
https://github.com/NVIDIA/TensorRT-LLM
模型系列 支持的模型/变体 关键信息
Llama 系列 Llama 2, Llama 3, Llama 3.1, Llama 3.2 (视觉), Llama 4 支持包括视觉多模态在内的完整Llama家族。
Qwen 系列 Qwen2, Qwen2.5, Qwen3, Qwen3 MoE, QwQ, Qwen2-VL, Qwen2.5-VL, Qwen3-VL 支持从纯文本到视觉语言模型(VL)的丰富Qwen生态。
DeepSeek 系列 DeepSeek-V3, DeepSeek-V3.2, DeepSeek-R1 支持最新的DeepSeek架构。
Google Gemma Gemma, Gemma 2, Gemma 3 (含视觉版本) 支持最新Gemma 3模型及多模态版本。
微软 Phi Phi-3, Phi-4, Phi-4-mini, Phi-4-multimodal 支持Phi-4系列及多模态变体。
Mistral Mistral 7B, Mixtral 8x7B, Mistral 3 (视觉) 支持Mistral和Mixtral模型,以及Mistral 3视觉版本。
NVIDIA 自研 Nemotron-3/4, Minitron, NemotronNAS 对NVIDIA自研模型提供原生支持与优化。
视觉/多模态 LLaVA-NeXT, VILA, FLUX, Wan2.1/2.2 涵盖图像/视频理解与生成模型,范围正在扩大。
其他重要模型 GPT-OSS, EXAONE 4.0, GLM-4.7-Flash, MiniMax M2, HyperCLOVA X 支持社区中多个有影响力的开源模型。