本地运行 AI 模型,像ollama,LMstudio等 都是多模型适配的。下面这几个做了独立优化

目前网信息比较多的加速器有3个,dflash FreeToken和TensorRT-LLM   仅支持少量模型,有多有少,自行查询 
1. dflash
https://github.com/z-lab/dflash
支持模型有:
模型系列    目标模型    DFlash 草稿模型
Qwen (通义千问)    Qwen3.6-27B    z-lab/Qwen3.6-27B-DFlash
Qwen3.6-35B-A3B    z-lab/Qwen3.6-35B-A3B-DFlash
Qwen3.5-4B    z-lab/Qwen3.5-4B-DFlash
Qwen3.5-9B    z-lab/Qwen3.5-9B-DFlash
Qwen3.5-27B    z-lab/Qwen3.5-27B-DFlash
Qwen3.5-35B-A3B    z-lab/Qwen3.5-35B-A3B-DFlash
Qwen3.5-122B-A10B    z-lab/Qwen3.5-122B-A10B-DFlash
Qwen3.5-397B-A17B    z-lab/Qwen3.5-397B-A17B-DFlash
Qwen3-4B (非思考模式)    z-lab/Qwen3-4B-DFlash-b16
Qwen3-8B (非思考模式)    z-lab/Qwen3-8B-DFlash-b16
Qwen3-Coder-Next    z-lab/Qwen3-Coder-Next-DFlash
Qwen3-30B-A3B-Coder    z-lab/Qwen3-30B-A3B-Coder-DFlash
Gemma    gemma-4-26B-A4B-it    z-lab/gemma-4-26B-A4B-it-DFlash
gemma-4-31B-it    z-lab/gemma-4-31B-it-DFlash
GPT-OSS    gpt-oss-20b    z-lab/gpt-oss-20b-DFlash
gpt-oss-120b    z-lab/gpt-oss-120b-DFlash
MiniMax    MiniMax-M2.5    z-lab/MiniMax-M2.5-DFlash
MiniMax-M2.7    z-lab/MiniMax-M2.7-DFlash
Kimi (月之暗面)    Kimi-K2.5    z-lab/Kimi-K2.5-DFlash
Llama    Llama-3.1-8B-Instruct    z-lab/LLaMA3.1-8B-Instruct-DFlash-UltraChat
GLM    GLM-5.1    即将推出
DeepSeek    DeepSeek-V4-Flash / Pro    即将推出


2. FreeToken ,不支持mac os
https://github.com/FlashML-org/FreeToken
https://www.flashml.ai/
支持模型
模型系列    代表模型    关键特征
DeepSeek    DeepSeek-V4-Flash (284B)    可在 32GB 显存的游戏台式机上以交互速度运行 (22-25 token/s)
Qwen (通义千问)    Qwen3.6-35B-A3B (35B)    可在 8GB 显存的笔记本上达到 39.3 token/s 的推理速度
GLM (智谱)    GLM-5.2 (753B)    可在单张 96GB 显存的工作站显卡上成功运行    


3 TensorRT-LLM  - 仅支持英伟达运行AI
https://github.com/NVIDIA/TensorRT-LLM

模型系列    支持的模型/变体    关键信息
Llama 系列    Llama 2, Llama 3, Llama 3.1, Llama 3.2 (视觉), Llama 4    支持包括视觉多模态在内的完整Llama家族。
Qwen 系列    Qwen2, Qwen2.5, Qwen3, Qwen3 MoE, QwQ, Qwen2-VL, Qwen2.5-VL, Qwen3-VL    支持从纯文本到视觉语言模型(VL)的丰富Qwen生态。
DeepSeek 系列    DeepSeek-V3, DeepSeek-V3.2, DeepSeek-R1    支持最新的DeepSeek架构。
Google Gemma    Gemma, Gemma 2, Gemma 3 (含视觉版本)    支持最新Gemma 3模型及多模态版本。
微软 Phi    Phi-3, Phi-4, Phi-4-mini, Phi-4-multimodal    支持Phi-4系列及多模态变体。
Mistral    Mistral 7B, Mixtral 8x7B, Mistral 3 (视觉)    支持Mistral和Mixtral模型,以及Mistral 3视觉版本。
NVIDIA 自研    Nemotron-3/4, Minitron, NemotronNAS    对NVIDIA自研模型提供原生支持与优化。
视觉/多模态    LLaVA-NeXT, VILA, FLUX, Wan2.1/2.2    涵盖图像/视频理解与生成模型,范围正在扩大。
其他重要模型    GPT-OSS, EXAONE 4.0, GLM-4.7-Flash, MiniMax M2, HyperCLOVA X    支持社区中多个有影响力的开源模型。