
Yi 开源大语言模型完全指南从模型选型、本地部署到微调量化的全流程实战【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/Yi导读本文以 Yi 项目官方中文文档README_CN.md为核心系统梳理 Yi 系列开源大语言模型的完整技术图谱包括 6B/9B/34B 多尺寸双语模型矩阵、基于 Transformers/Docker/conda-lock/llama.cpp/Web demo 的五种本地部署路径、DeepSpeed 驱动的监督微调SFT与 LoRA 低资源微调、GPTQ/AWQ 后训练量化以及完整的硬件部署要求与基准测试方法。读完本文你将掌握从「下载模型 → 配置环境 → 本地推理 → 定制微调 → 量化压缩 → 评估部署」的端到端实战能力并能结合仓库源码理解每一步背后的实现原理。一、Yi 是什么从零训练的双语大模型家族Yi 系列模型是 01.AI 从零训练的下一代开源大语言模型是一个在 3T 多语言语料库上训练而成的中英双语模型在语言认知、常识推理、阅读理解等方面表现优异。值得注意的是Yi 系列模型采用与 Llama 相同的模型架构但它们不是Llama 的衍生品——01.AI 从零构建了自己的高质量训练数据集、训练流水线和基础设施不使用 Llama 的任何权重。关于「Yi 与 Llama 的关系」官方文档给出了清晰的技术解释Yi 和 Llama 都基于 Transformer 结构自 2018 年以来大语言模型的常用架构Llama 凭借稳定性、收敛可靠性和生态兼容性成为大多数开源模型的基石因此也成为 Yi 的基础框架得益于该架构开发者可以复用 Llama 生态中现有的工具、库和资源提高开发效率但决定模型表现的关键因素是训练数据集、训练管道及其基础设施Yi 在这些方面都是自主从零构建的。1.1 模型矩阵Chat 与 Base 两大系列Yi 系列模型提供多种参数规模适配不同使用场景也可通过微调满足特定需求。所有模型均提供 Chat对话微调版与 Base预训练基础版两种形态部分型号附带官方量化版。Chat 模型对话版模型说明Yi-34B-Chat旗舰对话模型Yi-34B-Chat-4bitsAWQ 量化版4-bitYi-34B-Chat-8bitsGPTQ 量化版8-bitYi-6B-Chat轻量对话模型Yi-6B-Chat-4bitsAWQ 量化版4-bitYi-6B-Chat-8bitsGPTQ 量化版8-bitBase 模型基础版模型说明Yi-34B旗舰基础模型Yi-34B-200K200K 超长上下文版Yi-9B代码与数学能力最强的 Yi 模型Yi-9B-200K200K 超长上下文版Yi-6B轻量基础模型Yi-6B-200K200K 超长上下文版说明200K 上下文大约相当于 40 万个汉字4-bits 模型由 AWQ 量化、8-bits 模型由 GPTQ 量化量化版使用门槛较低可在消费级 GPU如 RTX 3090、RTX 4090上部署。1.2 模型信息一览系列定位默认上下文窗口预训练 tokens训练数据6B 系列适合个人和学术使用4K3T截至 2023 年 6 月9B 系列Yi 中代码和数学能力最强4K在 Yi-6B 基础上用 0.8T tokens 继续训练截至 2023 年 6 月34B 系列适合个人、学术和商业用途对中小企业友好34B 属开源社区稀缺的「黄金比例」尺寸具备涌现能力4K3T截至 2023 年 6 月1.3 Chat 模型的特性与使用提示Chat 模型在训练中采用监督微调SFT技术。与常规 Chat 模型相比Yi 系列 Chat 模型生成的回复更加多样化这带来两方面的效果优势适用于各种下游任务例如创意场景有利于提高回复质量对后续强化学习RL训练帮助很大需要留意的问题幻觉模型可能生成错误或不连贯的信息重新生成的回复不一致采样时结果可能存在前后差异累积误差回复错误随时间累积在扩展推理、数学解题等复杂任务中更易出现建议为获得更连贯一致的回复可调整生成配置参数如温度 temperature、top_p、top_k在创意性与逻辑连贯性之间取得平衡。仓库中的实际推理代码也印证了这套生成参数实践如 demo/text_generation_tp.py 在生成时默认使用temperature0.7、top_k40、top_p0.8、repetition_penalty1.3、no_repeat_ngram_size5的组合见该文件第 98-109 行。1.4 最新动态与模型演进官方文档按时间线记录了 Yi 系列的演进历程数据均以文档发布时的信息为准2023-11-02首次开源 Yi-6B-Base 与 Yi-34B-Base以 4K 序列长度训练推理时可扩展到 32K2023-11-05发布 Yi-6B-200K 与 Yi-34B-200K Base 模型上下文窗口扩展到 200K2023-11-23开源六大 Chat 模型含 AWQ 4-bits 与 GPTQ 8-bits 量化版社区许可协议更新至 2.1 版本2024-01-23发布 Yi-VL-34B 与 Yi-VL-6B 多模态语言大模型2024-03-06发布 Yi-9B在相近尺寸模型中表现突出2024-03-07增强 Yi-34B-200K 长文本记忆与检索能力大海捞针能力从 89.3% 提升至 99.8%通过在 5B tokens 长文本数据集上继续预训练达成2024-03-08发布 Yi 技术报告arXiv:2403.046522024-03-16发布 Yi-9B-200K2024-07-26发布 Yi Cookbook 1.0中英文教程与示例位于仓库 Cookbook 目录。二、快速上手五种本地部署路径全解官方文档提供了清晰的「学习路径选择」框架你可以根据自身硬件资源决定采用哪种方式资源充足如 NVIDIA A800 80GB选择 pip、Docker 或 conda-lock 方式资源有限如一台 MacBook Pro选择 llama.cpp 方式GGUF 量化模型不想本地部署可使用 Yi API、Yi Playground 或 Yi Chat 等在线服务官方白名单制或第三方平台。下面逐一详解各条路径。2.1 路径一PyPipip install本地推理官方教程以A80080GB本地机器运行 Yi-34B-Chat 为例。第 0 步前提条件Python 3.10 以上版本硬件满足「部署要求」中的规定。第 1 步准备环境git clone https://github.com/01-ai/Yi.git cd yi pip install -r requirements.txt仓库根目录的 requirements.txt 内容如下可据此确认核心依赖版本transformers4.36.2 gradio4.13.0 protobuf4.25.1 torch2.0.1 accelerate sentencepiece deepspeed datasets第 2 步下载模型可从 Hugging Face01-ai 组织、ModelScope01ai 组织、WiseModel01.AI 组织等平台下载。第 3 步进行推理使用 Chat 模型推理创建quick_start.py内容如下from transformers import AutoModelForCausalLM, AutoTokenizer model_path your-model-path tokenizer AutoTokenizer.from_pretrained(model_path, use_fastFalse) # 自 transformers 4.35.0 起GPTQ/AWQ 模型可直接用 AutoModelForCausalLM 加载 model AutoModelForCausalLM.from_pretrained( model_path, device_mapauto, torch_dtypeauto ).eval() # Prompt content: hi messages [ {role: user, content: hi} ] input_ids tokenizer.apply_chat_template(conversationmessages, tokenizeTrue, add_generation_promptTrue, return_tensorspt) output_ids model.generate(input_ids.to(cuda)) response tokenizer.decode(output_ids[0][input_ids.shape[1]:], skip_special_tokensTrue) # Model response: Hello! How can I assist you today? print(response)然后运行python quick_start.py预期输出Hello! How can I assist you today?。使用 Base 模型推理步骤与 Chat 模型类似。官方推荐直接使用仓库现成的推理脚本 demo/text_generation.pypython demo/text_generation.py --model your-model-path从源码看该脚本提供了丰富的参数见 demo/text_generation.py参数默认值说明--model01-ai/Yi-6B本地模型路径或 Hugging Face 模型名--max-tokens256最大生成 token 数--streaming关闭是否启用流式输出基于TextStreamer--promptLet me tell you an interesting story about cat Tom and mouse Jerry,起始提示词--cpu关闭仅用 CPU 运行此时device_mapcpu其默认推理配置在源码中可见demo/text_generation.pydevice_mapauto、torch_dtypeauto生成部分预留了do_sample、repetition_penalty、no_repeat_ngram_size、temperature、top_k、top_p等注释参数位便于按需开启。使用 Yi-9B 推理代码能力示例输入from transformers import AutoModelForCausalLM, AutoTokenizer MODEL_DIR 01-ai/Yi-9B model AutoModelForCausalLM.from_pretrained(MODEL_DIR, torch_dtypeauto) tokenizer AutoTokenizer.from_pretrained(MODEL_DIR, use_fastFalse) input_text # write the quick sort algorithm inputs tokenizer(input_text, return_tensorspt).to(model.device) outputs model.generate(**inputs, max_length256) print(tokenizer.decode(outputs[0], skip_special_tokensTrue))输出为一段完整的快速排序 Python 实现演示了 Yi-9B 的代码生成能力。2.2 路径二Docker 容器部署本教程在本地 Docker配置为A800 GPU 或 4×RTX 4090上运行 Yi-34B-Chat。第 0 步准备工作安装 Docker 与 nvidia-container-toolkitNVIDIA 容器工具包。第 1 步启动容器docker run -it --gpus all \ -v your-model-path:/models ghcr.io/01-ai/yi:latest也可以从registry.lingyiwanwu.com/ci/01-ai/yi:latest拉取已构建好的镜像。第 2 步进行推理步骤与 pip 路径一致唯一区别是model_path应设置为容器内的挂载路径your-model-mount-path而非宿主机路径。仓库根目录的 Dockerfile 可供查看镜像构建细节。2.3 路径三conda-lock 完全可重现环境如需创建一个完全可重现的 conda 环境锁定文件可使用 conda-lock 记录了所有依赖项的具体版本信息可用 micromamba 安装根据官方指南安装 micromamba执行命令创建一个名为yi的 conda 环境并安装所需依赖micromamba install -y -n yi -f conda-lock.yml2.4 路径四llama.cpp低资源设备首选官方教程以MacBook Pro16GB 内存Apple M2 Pro 芯片运行 Yi-chat-6B-2bitsGGUF 量化模型为例适合资源有限的场景。步骤 0前提条件安装 git-lfs。步骤 1下载 llama.cppgit clone gitgithub.com:ggerganov/llama.cpp.git步骤 2下载 GGUF 量化模型# 先仅拉取仓库指针 GIT_LFS_SKIP_SMUDGE1 git clone https://huggingface.co/XeIaso/yi-chat-6B-GGUF # 再拉取具体的量化权重 git-lfs pull --include yi-chat-6b.Q2_K.gguf步骤 3推理有两种方式方式 1终端推理默认续写模式可用./main -h查看更多自定义选项make -j4 ./main -m /Users/yu/yi-chat-6B-GGUF/yi-chat-6b.Q2_K.gguf -p How do you feed your pet fox? Please answer this question in 6 simple steps:\nStep 1: -n 384 -e模型会按 6 个步骤详细回答喂养宠物狐狸的方法说明量化后的 Yi 依然具备良好的指令遵循能力。方式 2Web 界面推理./server --ctx-size 2048 --host 0.0.0.0 --n-gpu-layers 64 --model /Users/yu/yi-chat-6B-GGUF/yi-chat-6b.Q2_K.gguf启动日志会显示 Metal 后端加载Apple M2 Pro、上下文大小 2048、KV cache 等信息并提示llama server listening at http://0.0.0.0:8080。在浏览器打开该地址即可进入聊天界面提问。关于 llama.cpp 在仓库内的进一步说明可参考 docs/README_llama.cpp.md。2.5 路径五Web demoGradio 交互界面你可以使用Yi Chat 模型Yi-34B-Chat创建 Web demo。注意Yi Base 模型Yi-34B不支持该功能因为对话界面依赖 Chat 模型的对话模板。启动命令python demo/web_demo.py -c 你的模型路径命令运行完毕后在浏览器中打开控制台提供的网址即可使用。结合 demo/web_demo.py 源码可以了解该界面的完整设计停止条件自定义StopOnTokens停止准则第 17-27 行当生成 token 命中[2, 6, 7, 8]分别对应|endoftext|、|im_start|、|im_end|、|im_sep|时立即停止保证回复格式干净对话模板基于tokenizer.apply_chat_template组装多轮消息第 75-77 行并支持代码块等 Markdown 渲染parse_text函数可调参数Maximum length 滑块范围 0-32768默认 4096、Top P 滑块 0-1默认 0.8、Temperature 滑块 0.01-1默认 0.6另内置repetition_penalty1.2——这与第一节提到的「调整生成参数以获得连贯回复」的建议完全对应流式输出借助TextIteratorStreamer与多线程model.generate实现逐 token 流式显示第 78-97 行CLI 参数第 170-199 行-c/--checkpoint-path默认01-ai/Yi-6B-Chat、--cpu-only、--share、--inbrowser默认开启、--server-port默认 8111、--server-name默认 127.0.0.1。2.6 进阶DeepSpeed 张量并行推理除官方文档介绍的路径外仓库还提供了面向多卡场景的推理脚本 demo/text_generation_tp.py它通过 DeepSpeed 的auto_tp自动张量并行模块加载模型第 56-83 行自定义is_load_module函数明确指定需要加载为并行层的模块类型包括nn.Linear、nn.Embedding、nn.LayerNorm以及LlamaRMSNorm、YiRMSNorm等命名层——这印证了 Yi 模型内部确实采用 Llama 风格的 RMSNorm 结构通过deepspeed.init_inference(model, mp_sizeWORLD_SIZE)按WORLD_SIZE环境变量切分多卡第 81-83 行适合在单机多卡环境加速 34B 级别模型的推理默认生成参数与官方推荐的连贯性配置一致do_sampleTrue、repetition_penalty1.3、no_repeat_ngram_size5、temperature0.7、top_k40、top_p0.8第 98-109 行并支持--eos-token默认|endoftext|自定义终止符。三、微调SFT把 Yi 变成你的专属模型官方文档提供了完整的微调方案在 Yi-6B / Yi-34B Base 模型上使用 finetune 目录下的代码基于自定义数据进行监督微调SFT。3.1 数据准备默认使用来自 BAAI/COIG 的小型数据集微调 Base 模型也可以按如下jsonl格式准备自定义数据集{ prompt: Human: Who are you? Assistant:, chosen: Im Yi. }仓库内 finetune/yi_example_dataset/data 提供了示例数据集train.jsonl 与 eval.jsonl是官方从 BAAI/COIG 修改而来可直接用于跑通流程。若通过 Docker 微调可将自定义数据集挂载进容器替换默认数据docker run -it \ -v /path/to/save/finetuned/model/:/finetuned-model \ -v /path/to/train.jsonl:/yi/finetune/data/train.json \ -v /path/to/eval.jsonl:/yi/finetune/data/eval.json \ ghcr.io/01-ai/yi:latest \ bash finetune/scripts/run_sft_Yi_6b.sh3.2 本地环境准备官方推荐通过 conda 创建 Python 3.10 环境并安装依赖conda create -n dev_env python3.10 -y conda activate dev_env pip install torch2.0.1 deepspeed0.10 tensorboard transformers datasets sentencepiece accelerate ray2.73.3 硬件要求Yi-6B 微调建议使用 4 卡节点每卡显存大于 60GBYi-34B 微调采用 ZeRO 卸载offload技术会占用大量 CPU 内存因此需要限制 GPU 数量。常用配置为 8 卡节点通过CUDA_VISIBLE_DEVICES0,1,2,3限制为 4 卡每卡显存大于 80GB总 CPU 内存大于 900GB。脚本 finetune/scripts/run_sft_Yi_34b.sh 开头即带有export CUDA_VISIBLE_DEVICES0,1,2,3 # limit parallelism to avoid cpu oom注释。3.4 启动微调cd finetune/scripts bash run_sft_Yi_6b.sh以 finetune/scripts/run_sft_Yi_6b.sh 为例其核心训练配置如下参数值含义--data_path../yi_example_dataset/训练数据目录--model_name_or_path/base_model预训练模型路径需改为你的 MODEL_PATH--per_device_train_batch_size1每卡训练 batch 大小--per_device_eval_batch_size1每卡评估 batch 大小--max_seq_len4096最大序列长度--learning_rate2e-6学习率--weight_decay0.权重衰减--num_train_epochs4训练轮数--training_debug_steps20每隔多少步打印训练信息--gradient_accumulation_steps1梯度累积步数--lr_scheduler_typecosine学习率调度策略余弦退火--num_warmup_steps0warmup 步数--seed1234随机种子--gradient_checkpointing开启梯度检查点省显存--zero_stage2DeepSpeed ZeRO 优化等级--deepspeed开启启用 DeepSpeed--offload开启优化器状态卸载到 CPU--output_dir./finetuned_model输出目录这些参数对应 finetune/sft/main.py 中通过 argparse 解析的完整参数体系该文件共 415 行还支持--data_split、--sft_only_data_path、--data_output_path等高级选项。在 6B 规模下设置training_debug_steps20与num_train_epochs4约 20 分钟即可产出一个可用的 Chat 模型34B 模型初始化时间相对较长请耐心等待。3.5 低资源方案LoRA 微调如果资源有限仓库还提供 LoRA 微调脚本 finetune/scripts/run_sft_lora_Yi_6b.sh在 SFT 脚本基础上增加--lora_dim 128 \ --lora_module_name layers. \ --output_dir ./output_Yi_6b_chat_sft_lora--lora_dim 128指定 LoRA 低秩矩阵维度--lora_module_name layers.指定注入 LoRA 的模块名模式。对应实现位于 finetune/utils/module/lora.py提供了convert_linear_layer_to_lora、convert_lora_to_linear_layer、only_optimize_lora_parameters等关键函数用于将线性层转为 LoRA 结构、训练后合并回原始权重、以及只优化 LoRA 参数以大幅减少可训练参数量。关于 FP16/BF16 微调显存占用官方 FAQ 给出的参考是34B 全参数微调约需 8×80GB 显存LoRA 等低资源方案所需资源少得多并建议使用 BF16 代替 FP16 以获得更优性能。3.6 评估微调效果微调完成后运行评估脚本对比微调模型与 Base 模型的回复差异cd finetune/scripts bash run_eval.sh脚本 finetune/scripts/run_eval.sh 调用 finetune/sft/prompt_eval.py通过--model_name_or_path_base/base_model与--model_name_or_path_finetune/finetuned_model指定两个模型并以--language Chinese选择中文提示语进行对比评测。微调选型建议官方 FAQ数据量大如超过 10,000 条样本时选择 Base 模型微调数据量不大时选择 Chat 模型更合适也建议两者都微调后对比选择Yi-34BBase全量微调更通用、性能上限相对较高适合对数据质量有充足信心的场景Yi-34B-Chat 微调生成的回答更符合人类交谈风格适合希望模型更像人或对数据质量信心不足的场景。四、量化GPTQ 与 AWQ 后训练压缩量化是在资源受限环境部署大模型的关键手段。官方文档介绍了两种后训练量化方法对应代码位于 quantization 目录。4.1 GPTQ 量化GPTQ 是一种后训练量化方法帮助大模型节省内存、保持准确性并加快运行速度。对 Yi 模型进行 GPTQ 量化需使用 AutoGPTQ 和 exllamaHugging Face Transformers 已集成 optimum 与 auto-gptq。量化模型核心命令python quantization/gptq/quant_autogptq.py \ --model /base_model \ --output_dir /quantized_model \ --trust_remote_code更详细的参数版python quant_autogptq.py --model /base_model \ --output_dir /quantized_model --bits 4 --group_size 128 --trust_remote_code其中--bits 4指定量化位宽官方 Chat 模型的 8-bits 版即由此方法量化--group_size 128指定量化分组大小。评估量化模型python quantization/gptq/eval_quantized_model.py \ --model /quantized_model \ --trust_remote_code4.2 AWQ 量化AWQ 也是一种后训练量化方法将模型权重高效准确地转化为低位数据如 INT3/INT4减小内存占用、保持准确性运行需使用 AutoAWQ。量化模型核心命令python quantization/awq/quant_autoawq.py \ --model /base_model \ --output_dir /quantized_model \ --trust_remote_code评估量化模型python quantization/awq/eval_quantized_model.py \ --model /quantized_model \ --trust_remote_code结合 quantization/awq/quant_autoawq.py 源码第 15-25 行可以看到 AWQ 量化的核心配置结构quant_config { zero_point: True, q_group_size: args.group_size, # 默认 128 w_bit: args.bits, # 默认 4 } model.quantize(tokenizer, quant_configquant_config) model.save_quantized(args.output_dir, safetensorsTrue) tokenizer.save_pretrained(args.output_dir)即默认启用零点量化zero_point、4-bit 位宽、128 分组大小量化结果以 safetensors 格式保存同时保存 tokenizer 以便直接加载使用。仓库还提供了 AWQ 量化的独立文档 quantization/awq/README.md 与 GPTQ 的 quantization/gptq/README.md。量化性能说明官方 FAQ量化模型与原版模型在性能上的差异很大程度上取决于量化方法与应用场景。以 AWQ 官方模型为例从客观 Benchmark 看量化可能导致性能下降几个百分点而从主观角度看在逻辑推理等场景中即使只有 1% 的差异也可能影响输出正确性。请根据场景权衡精度与资源。五、在线服务与第三方生态如果不想在本地部署官方文档提供了以下在线使用方式Yi APIYi 官方 API白名单制开放或第三方平台如 ReplicateYi Playground官方 Playground支持系统提示、温度、重复惩罚等自定义选项或第三方 PlaygroundYi ChatHugging Face Spaces 官方空间无需注册或 Yi 官方在线聊天平台白名单制。六、为什么选择 Yi生态兼容与基准测试6.1 上游生态与 Llama 架构兼容Yi 系列模型遵循与 Llama 相同的模型架构以 Llama 模型格式保存因此可以直接复用 Llama 生态中的工具、库和资源。例如可以直接用LlamaForCausalLM与LlamaTokenizer加载from transformers import AutoModelForCausalLM, AutoTokenizer tokenizer AutoTokenizer.from_pretrained(01-ai/Yi-34b, use_fastFalse) model AutoModelForCausalLM.from_pretrained(01-ai/Yi-34b, device_mapauto)这一兼容性也体现在仓库源码中前文提到的 demo/text_generation_tp.py 的is_load_module函数同时列出了LlamaRMSNorm与YiRMSNorm两种命名印证了 Yi 对 Llama 架构的兼容与自身适配。6.2 下游生态服务、量化、微调与 API官方文档整理了下游生态均为第三方社区基于 Yi 构建的成果服务基于 Yi-34B-Chat 的在线聊天平台、Replicate 平台上的 Yi-6B-Chat可设置自定义参数调用 API、ScaleLLM本地运行 Yi 模型量化TheBloke 等社区提供的 Yi-34B GPTQ / GGUF / AWQ 量化版本微调TheBloke 的 Yi 微调模型如 dolphin-2_2-yi-34b-AWQ、SUSTech/SUS-Chat-34B、OrionStar-Yi-34B-Chat-Llama、Nous-Capybara-34B 等社区微调成果APIamazing-openai-api将 Yi API 转为 OpenAI API 格式、LlamaEdgeRust 编写的 OpenAI 兼容 API 服务器基于 Wasm 构建。6.3 基准测试方法与结果官方文档基于特定时间点的公开测评数据说明模型性能数据截止时间以文档标注为准Chat 模型Yi-34B-Chat 在 MMLU、CMMLU、BBH、GSM8k 等开源模型基准中表现领先。测评方法要点除 TruthfulQA 外采用 zero-shot 与 few-shot 结合的方式评估大部分 Chat 模型常用 zero-shot要求模型在明确指令或隐含信息指令下生成回复并从文本中提取答案部分模型不适用少数数据集指令、无法按要求格式输出会导致结果不理想C-Eval 结果来源于验证数据集。Base 模型Yi-34B / Yi-34B-200K在 MMLU、CMMLU、常识推理、阅读理解等方面表现突出。测评方法要点与 OpenCompass 等其他测试流程的结果可能存在差异Prompt、后处理策略和采样技术不同会导致显著差异本测评与原始基准方法论一致相同提示语与后处理、贪心解码、不做任何生成后处理尝试推理采用 PIQA、SIQA、HellaSwag、WinoGrande、ARC、OBQA、CSQA阅读理解采用 SQuAD、QuAC、BoolQCSQA 使用 7-shot其余使用 0-shot数学与编码引入 GSM8K8-shot1、MATH4-shot1、HumanEval0-shot1、MBPP3-shot1。Yi-9B在综合能力Mean-All方面于相近尺寸开源模型中表现领先代码能力Mean-Code与数学能力Mean-Math突出常识与推理能力Mean-Text与同尺寸竞品不相上下。详细分项图表可查看 assets/img 下的 Yi-9B benchmark 系列图片。以上基准测试结果均来自官方文档发布的时期模型能力会随版本迭代变化请以实际测评为准。6.4 技术报告与引用更多关于 Yi 系列模型性能的详细信息可参阅技术报告「Yi: Open Foundation Models by 01.AI」arXiv:2403.04652。引用格式misc{ai2024yi, title{Yi: Open Foundation Models by 01.AI}, author{01. AI and : and Alex Young and Bei Chen and ...}, year{2024}, eprint{2403.04652}, archivePrefix{arXiv}, primaryClass{cs.CL} }七、部署要求软件与硬件清单7.1 软件要求模型类型所需软件Yi 4-bits 量化模型AWQ 和 CUDAAutoAWQYi 8-bits 量化模型GPTQ 和 CUDAAutoGPTQ7.2 Chat 模型硬件要求模型最低显存推荐 GPU 示例Yi-6B-Chat15 GB1×RTX 3090 / 4090 / A10 / A3024 GBYi-6B-Chat-4bits4 GB1×RTX 306012 GB/ 40608 GBYi-6B-Chat-8bits8 GB1×RTX 3070 / 40608 GBYi-34B-Chat72 GB4×RTX 409024 GB或 1×A80080 GBYi-34B-Chat-4bits20 GB1×RTX 3090 / 4090 / A10 / A3024 GB/ A10040 GBYi-34B-Chat-8bits38 GB2×RTX 3090 / 409024 GB或 1×A80040 GB不同 batch 下的最低显存要求模型batch1batch4batch16batch32Yi-6B-Chat12 GB13 GB15 GB18 GBYi-6B-Chat-4bits4 GB5 GB7 GB10 GBYi-6B-Chat-8bits7 GB8 GB10 GB14 GBYi-34B-Chat65 GB68 GB76 GB80 GBYi-34B-Chat-4bits19 GB20 GB30 GB40 GBYi-34B-Chat-8bits35 GB37 GB46 GB58 GB7.3 Base 模型硬件要求模型最低显存推荐 GPU 示例Yi-6B15 GB1×RTX 3090 / 4090 / A10 / A3024 GBYi-6B-200K50 GB1×A80080 GBYi-9B20 GB1×RTX 409024 GBYi-34B72 GB4×RTX 409024 GB或 1×A80080 GBYi-34B-200K200 GB4×A80080 GB注意上述为官方文档给出的参考配置实际显存占用会随输入长度、batch 大小及量化方式变化请在正式部署前用目标负载实测验证。八、FAQ微调、量化与通用问题速查官方文档 FAQ 汇总了社区高频问题微调相关Base 还是 Chat 上微调数据量 10,000 条选 Base数据量小选 Chat两者都试并对比更稳妥34B 与 34B-Chat 全量微调的区别Chat 模型采用 SFT 方式、回复更符合人类交谈风格Base 微调更通用、性能上限更高。对数据质量有信心选 Base追求对话风格或数据质量信心不足选 ChatYi-34B FP16 微调需要多少显存全参数微调约需 8×80GB 显卡LoRA 等低资源方案资源需求少得多。建议使用 BF16 代替 FP16。量化相关量化版与原版性能差异取决于量化方法与具体场景客观 Benchmark 上可能下降几个百分点在逻辑推理等场景中即使 1% 的差异也可能影响结果正确性。通用相关微调问答数据集可参考 COIG-CQIA 等 Hugging Face 数据集或使用 LLaMA-Factory 等框架整合的现成数据集Yi-34B-200K 的第三方 Chat 平台可参考 fireworks.ai 等。学习中心官方文档还整理了丰富的社区学习资源教程、博客、视频中英文皆有覆盖本地部署、量化、微调、多模态应用等主题仓库 Cookbook 目录下的 Yi Cookbook 1.0 也包含中英文教程与示例如 基于 LlamaIndex 和 Yi-large 构建智能问答系统、基于 yi-large 构建思维导图生成器、本地运行指南 等。九、许可证与使用范围Yi 系列模型对所有人开放使用。其代码和权重遵循 Apache 2.0 许可证即 Yi 系列模型可免费用于个人使用、学术研究和商业用途。模型的具体使用条款可进一步查阅 MODEL_LICENSE_AGREEMENT.txt社区许可协议 2.1 版本。结语本文基于官方中文文档从「Yi 是什么」的模型矩阵与架构定位出发完整覆盖了五种本地部署路径、SFT 与 LoRA 微调、GPTQ/AWQ 量化、部署硬件清单与基准测试方法并结合仓库源码推理脚本、微调脚本、量化脚本、依赖清单补充了参数细节与实现原理。无论你是想在 24GB 消费级显卡上跑量化版 Yi-6B-Chat还是计划用多卡 A800 微调 Yi-34B亦或是在 MacBook 上用 llama.cpp 轻量体验本文的配置与命令均可直接参考落地。更深入的源码细节可继续阅读仓库 demo、finetune、quantization 目录下的实现。【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/Yi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考