把操作系统管理内存的分页机制搬进显存,vLLM 用 PagedAttention 让 KV Cache 利用率从三四成提升到九成以上,同一块 GPU 并发翻倍——再加上 OpenAI 兼容 API 与连续批处理,自建大模型服务从实验走向生产就靠它。
内置 MLX 与 llama.cpp 引擎一键跑本地模型,12+ 云端提供商随时接入,对话中途换模型不用换窗口——Split Chats 把模型对比变成并排聊天,知识栈把 RAG 压缩成拖入即问。
把 PDF、Word、CSV 拖进工作区,就能得到一位读过你全部资料的 AI 助手——每条回答带引用标注,模型、向量库、存储全部默认本地运行。MIT 开源的 AnythingLLM 让私有 AI 工作台真正数据不出机。
纯 C/C++、零依赖的 llama.cpp 定义了 GGUF 量化格式,让没有显卡的电脑也能跑本地大模型。CUDA、Metal、Vulkan 全后端覆盖,llama-server 提供 OpenAI 兼容 API,是 Ollama 与 LM Studio 身后的那台引擎。
不需要显卡、不需要账号、不需要命令行:MIT 开源的 GPT4All 让普通电脑用 CPU 就能跑本地大模型,LocalDocs 把私有文档问答变成一个勾选项,数据全程不出本机。
一款 Apache 2.0 开源的本地 AI 助手:模型下载后断网照常对话,数据不出本机,代码全部公开可查,还能接云端模型、开本地 API、连 MCP 工具。
不用碰终端,点几下就能在本地跑开源大模型:Hugging Face 模型浏览器、类 ChatGPT 聊天界面、OpenAI 兼容 API 一站配齐,个人与商用全免费,数据不出本机。
一行命令就能在本地跑起 Llama、Qwen、DeepSeek 等开源大模型:MIT 开源、数据不出本机、OpenAI 兼容 API,让本地推理无缝接进你的编辑器与工作流。
一个约 5MB 的开源客户端,把 GPT、Claude、Gemini、DeepSeek 装进同一个对话窗口:MIT 协议、对话存本地、六端覆盖,多模型切换像换频道一样简单。
自托管 AI 平台 Open WebUI 把 Ollama 与 OpenAI 兼容 API 收进同一界面,内置 RAG 知识库、RBAC 权限与 SSO 登录,支持 MCP 扩展,适合团队私有化部署。
LibreChat 是 MIT 许可证下的开源 AI 对话平台,自托管部署,一个界面接入多家模型供应商,自带 Agents、代码解释器与 MCP 工具,适合想掌控模型成本的用户。
原名 LobeChat 的开源项目,如今升级成 AI 团队工作站:一句话配置 Agent、自动组队并行干活、给 Agent 排班、记忆做成可编辑白盒,还能接进常用聊天工具,支持本地模型与自行部署。
Poe 是 Quora 做的 AI 聚合平台,一个账号就能切换多家公司的模型。它更值得看的是机器人体系:超过 100 万个用户自制机器人,不懂代码也能用一段描述做出自己的,做出来还能按条定价收钱。
法国 Mistral AI 出品的 AI 助手,前身 Le Chat 于 2026 年 5 月更名 Vibe,工作助理与编码 agent 合成一个产品,官方口径约每秒一千词,数据默认托管在欧盟境内。
一款融入 Windows 与 Edge 的 AI 助手,能实时查看你主动共享的屏幕并指出下一步操作,支持语音唤起、浏览器翻页跟随与本地文件检索,免费档可直接上手,适合想把界面问题说清又懒得截图的用户。