本地 LLM 推理 C++ 引擎,CPU/GPU 高效运行 GGUF 模型。
llama.cpp 本地 LLM 推理 C++ 引擎,CPU/GPU 高效运行 GGUF 模型。
作为API 与模型领域的常用工具,llama.cpp 适合个人创作者与团队快速上手,可通过官网注册或 API 集成到现有工作流。
开源模型社区与 Inference API、Spaces 部署平台。
本地运行开源大模型的 CLI 工具,开发者自部署与集成首选。
AWS 多模态基础模型系列,对话与内容生成 API。
Ray 生态模型部署与 LLM 推理服务平台。