LocalAI 本地AI引擎快速上手:5步在任意硬件上跑通大模型,无需GPU指南
【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI
LocalAI 是一个开源的本地AI引擎,核心功能是把大语言模型、视觉、语音、图像和视频模型统一装进同一个服务,用一套 OpenAI 兼容的 API 对外提供。它不依赖专用 GPU,普通消费级电脑就能运行,适合想把 AI 部署在自己机器上的个人开发者、小团队,以及有数据不出内网要求的公司。
安装方式只有三种:macOS 的桌面应用、Docker 容器、命令行二进制。服务启动后自带一个 Web 界面,聊天、装模型、建智能体都在这一个页面里完成,不用再配任何额外工具。
LocalAI 的可组合架构:核心很小,后端按需拉取
LocalAI 的设计思路和"全家桶"不同。核心是一个小二进制文件,只负责 API 和服务路由;每个模型引擎(llama.cpp、vLLM、whisper.cpp、stable-diffusion、MLX 等)各自打包成独立的后端镜像,只有当你真正用到对应模型时才会被下载并启动。
这带来两个直接的好处:
- 📦 不装用不到的东西。只跑一个 1B 小模型,就不会拖进整套扩散模型组件
- 🔄 后端可独立升级、移除,甚至放到另一台机器上运行,单个后端出故障不会拖垮整个服务
后端之间走的是标准的 gRPC 接口,合同很简单,意味着你也可以用任意语言写一个自定义后端接进来,和内置后端享受同样的调用方式。
用 Docker 或桌面应用启动 LocalAI 服务
三种安装方式对应三类用户:
- macOS:下载官方 DMG,拖进 Applications 即可。桌面应用已做 Apple 开发者签名和公证,打开不会弹隔离警告
- Docker(推荐,跨平台):一条命令起服务,CPU 环境用
localai/localai:latest镜像;有 NVIDIA、AMD、Intel GPU 或 Vulkan 环境时,换成对应的 GPU 镜像并加上相应设备参数 - Linux / 服务器:直接用
local-ai命令行启动
全文只需要这一段命令,其余配置都有默认值:
docker run -p 8080:8080 --name local-ai -ti localai/localai:latest启动后访问http://localhost:8080就能打开 Web 界面。硬件加速不需要你手动指定驱动细节:LocalAI 会自动检测 GPU 能力,下载匹配的后端。GPU 镜像与硬件的完整对应表见 docs/content/getting-started/containers.md,macOS 安装细节见 docs/content/getting-started/macos.md。
在 WebUI 里安装第一个模型并发起对话
打开 Web 界面后,推荐的第一个动作是装一个对 CPU 友好的小模型:
- 进入 Models → Explore,搜索
qwen3-4b,点 Install,等下载完成 - 打开 Chat 页面,在下拉框选中它,发一条消息,几秒内就能看到回复
这个模型本身很小,但它支持工具调用,后面做智能体时还能直接复用。模型也可以从其他渠道安装:模型库、Huggingface 文件、Ollama 的 OCI 镜像、甚至一份 YAML 配置文件,local-ai run <名称>就能在启动时自动装好。
用 OpenAI 兼容 API 接入 LocalAI,现有代码基本不用改
LocalAI 最省事的兼容设计在这里:它对外暴露的是 OpenAI、Anthropic 和 Open Responses 三套标准 API。你手里已有的代码、SDK 或第三方工具,通常只需要把 base URL 指到http://localhost:8080,其余请求格式照旧。
几个常用的接入场景:
- 代码补全与脚本:把任何 OpenAI SDK 的 endpoint 换成本地地址
- 应用后端:现有调用 OpenAI 的服务,改一行配置就能指向内网的 LocalAI
- 命令行调试:用 curl 打
/v1/chat/completions快速验证服务是否正常
兼容的具体接口与参数,仓库的 docs/content/reference/ 目录下有逐条说明,包括 API 错误码和 CLI 参考。
图像、语音、视觉:用同一个服务跑多种模态
LocalAI 不只做文本。同一套 API 下,这些能力开箱即用:
- 图像生成:Stable Diffusion、Flux 等模型,接口风格与 OpenAI 图像 API 对齐
- 语音:文本转语音(TTS)、语音转文字(ASR),以及 Realtime API 支持的语音对语音实时对话
- 视觉:图像理解、目标检测,甚至人脸与声纹识别
- 向量与重排:Embeddings 和 Reranker 接口,方便搭检索类应用
每种模态由各自的后端负责,比如 TTS 走 whisper.cpp、parakeet.cpp 这类引擎。你不需要关心哪个模型属于哪个后端,装模型时会自动带起对应组件。
进阶玩法:多用户认证与分布式部署
个人用完之后,如果要放进团队环境,LocalAI 也留好了扩展位:
- 访问控制:设置
LOCALAI_API_KEY就能给 API 加密钥门槛;开启LOCALAI_AUTH后支持多用户、管理员/用户角色、OAuth 登录、按用户的 API 密钥和用量统计 - 分布式模式:用 PostgreSQL + NATS 做协调,把推理任务水平扩展到多台机器,支持前缀缓存感知的路由
- P2P 联邦:多台设备之间点对点组网做联邦推理,适合算力分散的场景
- 内置智能体:在 Web 界面里直接创建带工具调用、RAG 和 MCP 支持的自主智能体
模型与后端的具体支持关系,可以参考仓库根目录的 gallery/ 模型清单和官方文档中的兼容表。
开始使用:4步清单
- 按平台选一种安装方式:macOS 装 DMG 应用,其他环境跑 Docker 命令(见上文)
- 浏览器打开
http://localhost:8080,在 Models → Explore 安装qwen3-4b - 在 Chat 页面发第一条消息,确认本地推理跑通
- 把现有工具或代码的 API 地址指向
http://localhost:8080,需要共享部署时再配置 API 密钥
【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考