ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

如何搭建自己的开源法律助手:3 款中文法律大模型选型与部署指南

如何搭建自己的开源法律助手:3 款中文法律大模型选型与部署指南 如何搭建自己的开源法律助手3 款中文法律大模型选型与部署指南【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型以规模较小、可私有化部署、训练成本较低的模型为主包括底座模型垂直领域微调及应用数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM租房押金被扣、合同没看仔细、想查法条却看不懂——这些问题不必每次等律师回复。开源项目 Awesome-Chinese-LLM 把一批中文法律大模型整理在同一个仓库里基座、训练数据、算力配置都列得清楚足够你在自己的机器上搭一个开源法律助手。这篇笔记按选型 → 部署 → 使用的顺序带你走一遍坑也一并说在前面。能力清单法律咨询、合同审查AI与文书生成开源法律AI能干的事集中在几件上先对号入座能力典型场景适合人群法律咨询劳动争议、租房纠纷、侵权赔偿等日常问答遇到具体纠纷的普通用户合同审查AI签约前逐条过条款标出模糊或不对等的地方个人与小微经营者法律文书生成律师函、投诉信、起诉状初稿需要书面文书、预算有限的人法条与判例解读法条解释、案例拆解、类案检索思路法学生与法律从业者两个使用场景举例。其一签劳动协议或租房合同前把全文丢给模型逐条过一遍让它标出口头承诺不写进合同单方免责这类点你再决定要不要谈。其二需要发律师函或投诉信时先让模型出初稿你改完事实细节再发比对着空白文档发呆省事。一句话初稿能省时间但事实表述必须由你把关。法律大模型选型三款模型怎么挑仓库里法律方向的模型不止三个但资料最齐、最常引用的是下面三款。对比表基于仓库 doc/Legal.md 的记录模型基座团队数据特点适用场景獬豸 (LawGPT_zh)ChatGLM-6B上海交通大学20 万条真实律师用户问答用法条真实案例构造情景问答贴近实务的日常法律问答LaWGPTChinese-Alpaca-Plus-7B南京大学裁判文书网、司法考试、国家法律法规数据库等官方多源数据法条解释、案例分析ChatLaw姜子牙 Ziya-LLaMA-13B-v1另有 33B 版基于 Anima-33B北京大学论坛、新闻、法条、司法解释、法考题、判决文书混合后构造对话数据复杂问题、需要推理链条的场景每款一句选型建议獬豸要像律师一样说话的实务回答、机器配置一般选它6B 最省心。LaWGPT常查法条和判例、需要官方数据背书的选它协议是 GPL-3.0商用前看清条款。ChatLaw问题复杂、要完整推理过程的选它13B 对显存要求高小机器慎选。提醒一句三款都是 2023 年发布的法律条文持续更新它们的知识截止点就在各自训练数据里。新法、新司法解释出来之后模型不会自动知道。十分钟完成法律大模型部署法律大模型部署分三步拿仓库、备硬件、加载模型。第一步获取仓库。它本身是资源汇总模型权重和代码在各模型自己的开源仓库里按 doc/Legal.md 里的条目逐个找git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM第二步备硬件。仓库官方记录的是训练侧算力獬豸 4 张 NVIDIA 3090、LaWGPT 8 张 Tesla V100 32GB、ChatLaw 多张 V100推理侧没给统一标准按参数量估算分两档入门档獬豸、LaWGPT 这类 6B/7B 模型单张消费级显卡 12GB 显存起步4bit 量化后 8GB 也可以试。专业档ChatLaw-13B 这类 13B 模型建议 24GB 显存或者先做 4bit 量化再跑。没有独立显卡时 CPU 也能推理但速度只够测试不适合日常用。第三步加载模型。各仓库 README 都有示例脚本通用写法大致是这样from transformers import AutoModelForCausalLM, AutoTokenizer model AutoModelForCausalLM.from_pretrained(模型权重路径) tokenizer AutoTokenizer.from_pretrained(模型权重路径)跑通第一句对话就算部署完成。报错优先查依赖版本和显存占用这两个问题占大头。上手技巧提问、验证与更新提问方式直接决定回答质量。三条经验把问题写具体城市、角色、金额、时间都要有北京租房押一付三被扣押金比租房被坑了有效得多。先给背景再提问一句话交代事实经过再问法律点。复杂问题拆开问先问这算违约吗再问我能主张哪些赔偿一次问完反而容易漏。结果验证不能省。模型给出的法条编号、条款序号去官方法律法规数据库核对一遍原文。模型会编法条这是大模型的通病在法律领域代价最大。维护上两件事定期看各模型仓库有没有新版权重新法规出来之后用检索增强RAG外挂一份最新法规库比干等模型更新更直接仓库里 DISC-LawLLM 就是带检索增强模块的可以参考它的做法。进阶了解架构分层与发展方向这类系统的结构大致是三层底层通用基座ChatGLM、LLaMA 系中间法律语料继续预训练加指令微调顶层按任务挂应用接口——ChatLaw 配了个 Text2Vec 法条匹配模型DISC-LawLLM 挂了检索增强都属于这一层。方向上检索增强和多模态直接读合同扫描件是接下来最值得跟的两条线。更多模型的细节License、数据构成、算力都在官方文档doc/Legal.md。建议先拿獬豸跑通第一句对话再按你的问题类型换第二款模型对比一次别贪多。【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型以规模较小、可私有化部署、训练成本较低的模型为主包括底座模型垂直领域微调及应用数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表