ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Xinference 部署 codestral-v0.1:四种模型规格、量化选项与启动命令全解

Xinference 部署 codestral-v0.1:四种模型规格、量化选项与启动命令全解 Xinference 部署 codestral-v0.1四种模型规格、量化选项与启动命令全解【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference本文基于 Xinference 内置模型文档 codestral-v0.1.rst 展开完整覆盖该模型的规格参数32K 上下文、四套模型格式/量化组合、对应的xinference launch启动命令并结合仓库源码说明这些参数在启动流程中的解析逻辑与模型清单的加载机制帮助你把 Mistral 官方的代码专用模型 codestral-v0.1 一键部署为统一的 OpenAI 兼容推理服务。模型概览codestral-v0.1 是什么codestral-v0.1官方全名 Codestral-22B-v0.1是 Mistral AI 推出的 220 亿参数代码大语言模型。Xinference 内置文档给出的核心属性如下Context Length上下文长度32768Model Name模型名称codestral-v0.1Languages支持语言enAbilities能力generateDescriptionCodestrall-22B-v0.1 在涵盖 80 多种编程语言的多样化数据集上训练包括 Python、Java、C、C、JavaScript、Bash 等最流行的语言这组属性与仓库中内置模型清单 llm_family.json 的第一条记录完全一致——Xinference 的内置模型页面文档、WebUI、CLI 的模型列表都是由该 JSON 文件驱动的context_length、model_lang、model_ability与model_description字段逐项对应。这也解释了为什么文档页面中Context Length等字段与代码里的 JSON 结构一一对应。四套模型规格Model Spec详解Xinference 为 codestral-v0.1 提供了 4 套模型规格分别面向不同的硬件与运行场景。以下信息完整继承自 codestral-v0.1.rst并标注了 llm_family.json 中对应的补充细节如模型 revision 锁定。Spec 1pytorch 全精度版22BModel FormatpytorchModel Size (in billions)22QuantizationsnoneEnginesvLLM、Transformers、SGLangModel IDmistralai/Codestral-22B-v0.1Model HubsHugging Face仓库 JSON 中还锁定了model_revision: 8f5fe23af91885222a1563283c87416745a5e212确保下载到固定版本权重这是原始 PyTorch 权重版本不量化需要显存充足的多卡 GPU 环境22B 全精度权重约需 44GB 以上显存实际部署还需预留 KV Cache 空间。三种引擎中vLLM 与 SGLang 是连续批处理的高吞吐引擎Transformers 是 PyTorch 格式的默认兜底后端详见 backends.rst 中对各后端的说明。Spec 2ggufv2 量化版22Bllama.cpp 引擎Model Formatggufv2Model Size (in billions)22QuantizationsQ2_K、Q3_K_S、Q3_K_M、Q3_K_L、Q4_K_S、Q4_K_M、Q5_K_S、Q5_K_M、Q6_K、Q8_0Enginesllama.cppModel IDbartowski/Codestral-22B-v0.1-GGUF这一规格覆盖了 llama.cpp 生态常用的 10 档量化格式适合 CPU 或低显存场景。值得注意的是llm_family.json 中该规格还定义了model_file_name_template: Codestral-22B-v0.1-{quantization}.gguf即下载时会按量化档拼出对应的 GGUF 文件名因此选择--quantization Q4_K_M时实际拉取的就是Codestral-22B-v0.1-Q4_K_M.gguf。此外根据 backends.rstXinference 自 v1.5.0 起默认使用团队自研的xllamacpp替代llama-cpp-python后端并支持自动估算 GPU 层数auto NGL这些能力同样适用于本规格。Spec 3 与 Spec 4MLX 4bit / 8bit 版Apple Silicon规格Model FormatQuantizationsEnginesModel IDSpec 3mlx4bitMLXmlx-community/Codestral-22B-v0.1-4bitSpec 4mlx8bitMLXmlx-community/Codestral-22B-v0.1-8bit这两套规格面向 Apple SiliconMac平台的 MLX 推理框架分别提供 4bit 与 8bit 量化。仓库中对应的引擎实现位于 xinference/model/llm/mlx/ 目录。启动命令如何拉起 codestral-v0.1文档为每套规格给出了统一的启动命令模板只需将${engine}与${quantization}替换为该规格允许的值即可。pytorch 格式引擎任选 vLLM / Transformers / SGLang无量化xinference launch --model-engine vLLM \ --model-name codestral-v0.1 \ --size-in-billions 22 \ --model-format pytorch \ --quantization noneggufv2 格式llama.cpp 引擎 任选一档量化xinference launch --model-engine llama.cpp \ --model-name codestral-v0.1 \ --size-in-billions 22 \ --model-format ggufv2 \ --quantization Q4_K_MMLX 格式MLX 引擎 4bit 或 8bitxinference launch --model-engine MLX \ --model-name codestral-v0.1 \ --size-in-billions 22 \ --model-format mlx \ --quantization 4bit--quantization的取值必须来自对应规格列出的 Quantizations 列表pytorch 规格只接受noneggufv2 规格接受上表 10 档 K 量化mlx 规格只接受4bit或8bit。启动参数在源码中如何解析xinference launch命令定义在 cmdline.py 的model_launch函数中约 L745-L935文档中用到的参数与源码中的 click 选项一一对应命令行参数源码选项定义含义--model-name/-nrequiredTrue要启动的模型名此处为codestral-v0.1--model-engine/-en默认 None推理引擎源码在 L985-L986 强制校验LLM 模型必须指定引擎否则抛出--model-engine is required for LLM models.--size-in-billions/-s默认 None参数量十亿用于匹配多规格模型中的具体一条--model-format/-f默认 None模型格式pytorch / ggufv2 / mlx与量化共同定位规格--quantization/-q默认 None量化档位必须在该规格允许列表内此外源码还提供了文档未逐条列出但部署 22B 大模型时常用的扩展参数均可按需附加到同一条 launch 命令上--n-gpu默认autonone表示纯 CPU与--n-worker控制 GPU 数量与 worker 数--replica/--replica-config副本数与每副本的 worker/GPU 放置JSON 数组vLLM PD 分离场景下可在每个条目中设置prefill/decode角色--model-path/-mp直接指向本地模型路径跳过模型下载--gpu-idx/--worker-ip分布式场景下指定模型运行在哪台 worker 的哪些 GPU 上任意未显式定义的--key value透传参数会被收集为引擎 kwargs见model_launch函数开头的ctx.args解析逻辑例如向 vLLM 透传--max-model-len 32768以对齐该模型 32768 的上下文长度。模型清单的加载机制文档数据从哪来Xinference 启动时并不是硬编码模型列表而是解析 llm_family.json。加载入口位于 xinference/model/llm/init.pyload_model_family_from_json(llm_family.json, BUILTIN_LLM_FAMILIES)具体解析逻辑在 config_parser.pyL142 附近通过os.path定位该 JSON 文件。codestral-v0.1 在该文件中是一条完整的 family 记录包含version: 2、context_length、model_lang、model_ability、model_description以及 4 个model_specs与文档页面的四个 Model Spec 小节严格对应。从源码结构看这套机制带来两点可预期的行为规格定位唯一化由于 4 个规格共享同一个 model_name 与 22B 参数量必须用model-format quantization组合才能在model_specs中唯一定位到一条规格并选择对应的 Model ID 与下载源版本可复现pytorch 与 mlx 规格在 JSON 中带有model_revision字段分别为8f5fe23...、544626b...等 commit 级锁定ggufv2 规格则通过文件名模板锁定量化文件保证不同环境下载到的权重版本一致。选型建议与适用前提多卡 NVIDIA GPU 追求高吞吐选 pytorch 规格 vLLM 或 SGLang 引擎--quantization noneCPU / 边缘 / 低显存环境选 ggufv2 规格 llama.cpp 引擎按可用内存选量化档一般 Q4_K_M 是精度与体积的常用折中显存紧张可退到 Q3/Q2追求精度选 Q6_K 或 Q8_0Mac / Apple Silicon选 mlx 规格 MLX 引擎按内存预算选 4bit 或 8bit。适用前提提醒本文所有命令均以当前仓库的 cmdline.py 选项定义为准--model-engine的取值必须与规格 Engines 列一致例如 ggufv2 规格只支持 llama.cpp 引擎模型默认从 Hugging Face 下载离线环境可通过--model-path指定本地路径或结合 Docker 部署流程使用。启动成功后即可通过 Xinference 的统一 RESTful API 调用该模型无需为不同推理引擎修改客户端代码。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表