ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

LiteRT-LM本地化替代方案:用serve命令3步搭建私有AI网关

LiteRT-LM本地化替代方案:用serve命令3步搭建私有AI网关 LiteRT-LM本地化替代方案用serve命令3步搭建私有AI网关【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LMLiteRT-LM是 Google 推出的生产级、高性能开源推理框架可让大语言模型LLM直接在边缘设备与本地机器上运行。它的 CLI 工具内置了serve命令一条命令即可启动一个兼容 OpenAI API 协议的私有 AI 网关无需 API Key、数据永不离开本机聊天补全、模型列表、向量嵌入Embedding等请求全部由本地模型处理。本文带你用最快速度搭好属于自己的本地 LLM 网关。为什么需要本地化 LLM 推理在云端 API 之外私有化部署大模型有四大现实收益数据隐私对话内容完全留在本地不出局域网适合企业敏感场景零调用成本按 token 计费的云 API 变成一次性投入推理免费离线可用断网环境下依然可以完成补全与嵌入任务⚡硬件加速LiteRT-LM 支持 GPU / NPU 加速并支持 Gemma、Llama、Phi-4、Qwen 等主流模型覆盖 Android、iOS、桌面端与树莓派等边缘设备其serve命令实现了一个标准 HTTP 服务核心代码见 serve.py任何已对接 OpenAI SDK 的客户端只需换个地址就能无缝切换为调用本地模型。第1步导入本地模型先安装 CLI也可从源码构建构建说明见 CMakePresets.json 与 docs/getting-started/cmake.mdpip install litert-lm然后把.litertlm格式的模型文件导入本地模型库支持从本地路径导入也支持直接从 HuggingFace 仓库拉取实现见 import.py# 从本地路径导入 litert-lm import ./gemma-3-1b.litertlm my-gemma # 或从 HuggingFace 仓库导入 litert-lm import --from-huggingface-repo org/repo model.litertlm my-gemma用litert-lm list可以查看已导入的模型后续serve命令会以模型 ID 作为服务标识。第2步一条命令启动 serve 服务导入模型后启动私有 AI 网关只需一行litert-lm serve --host0.0.0.0 --port9379服务默认监听0.0.0.0:9379启动成功后它对外暴露以下 OpenAI 兼容端点见 openai_handler.py端点功能/v1/models获取已加载的模型列表/v1/chat/completions对话补全支持流式输出/v1/responses新版 Responses 风格接口/v1/embeddings文本/图像/音频向量化关键设计引擎采用首个请求时才加载的懒初始化策略——服务启动时不占内存第一个请求到来才初始化推理引擎当请求的模型、后端或参数变化时会自动重建引擎。这套生命周期管理逻辑在 serve_util.py 中实现。常用选项--port修改监听端口默认 9379--cors-origin允许浏览器前端跨域访问可多次指定默认禁用 CORS--verbose输出详细日志便于排查加载问题第3步把现有工具指向本地网关由于协议完全兼容 OpenAI你只需把客户端的base_url改为本地地址例如client OpenAI( api_keynot-needed, base_urlhttp://localhost:9379/v1, )这样任何基于 OpenAI SDK 的 Agent 框架、RAG 流水线、客服机器人都能零改造地跑在你的私有模型上。进阶能力让私有网关更强大多模态输入聊天接口支持图片与音频输入图片可用 base64 data URL、网络地址或本地文件路径传入。比如把下面这张测试图喂给支持视觉的模型即可做图像问答工具调用Tool UseLiteRT-LM 原生支持 Function CallingAgent 工作流中的函数调用、参数解析都在本地完成调用流程如下图所示性能调优可通过模型配置启用 GPU/NPU 后端、投机解码speculative decoding等加速选项相关字段解析见 model.py服务内部也会自动启用基准统计enable_benchmark帮助观察推理性能。浏览器直连加上--cors-origin后可以直接参考项目内置的 Web 聊天应用js/apps/chat/在自己页面里内嵌本地模型对话界面。常见问题 FAQQ1端口 9379 被占用怎么办用--port换一个端口即可例如litert-lm serve --port8000。Q2换模型需要重启服务吗不需要。服务收到不同模型的请求时会自动重建引擎日志中会提示 Re-initializing engine但注意多客户端同时请求不同模型会互相切换引擎生产环境建议一个服务固定一个模型。Q3支持哪些模型格式.litertlm打包格式可用litert-lm pack/unpack处理来源可以是本地文件、HuggingFace 仓库或实验性模型渠道。总结LiteRT-LM 的serve命令把私有 AI 网关的搭建门槛降到了最低导入模型 → 启动服务 → 切换 base_url三步即可拥有一套数据不出本机、协议兼容 OpenAI 的本地 LLM 推理服务。无论是企业内网部署、离线开发还是想摆脱按量计费它都是当下最完整的本地化替代方案之一。完整命令参考可查看 CLI 说明文档 python/litert_lm_cli/README.md命令入口注册逻辑见 main.py。【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表