AI 全流程指南
从模型开发到应用落地的全环节工具/平台
vllm
vLLM 是加州大学伯克利分校开源的 LLM 推理与部署引擎,首创 PagedAttention 技术,实现高吞吐、低延
llama
llama.cpp 是 ggml-org 开源的纯 C/C++ LLM 推理引擎,无需 GPU 即可在本地运行 AI 大