ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

little-coder技能卡片与算法知识注入:如何给9.7B小模型装上“外挂小抄“

little-coder技能卡片与算法知识注入:如何给9.7B小模型装上“外挂小抄“ little-coder技能卡片与算法知识注入如何给9.7B小模型装上外挂小抄【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coderlittle-coder 是一个专为小模型打造的本地编码智能体框架它的核心思路不是让模型变聪明而是给模型按需发小抄每一轮对话自动挑选最相关的技能卡片工具用法卡与算法知识卡注入上下文。正是这套知识注入外挂让 9.7B 的 Qwen3.5-9B 在 Aider Polyglot 基准上做到 45.6%是同模型原生脚手架19.1%的 2.4 倍。下面用 5 分钟讲清楚这套机制是如何运作的。 先看结果同一模型小抄带来 2.4 倍差距上面是白皮书中的核心对比同一个 9.7B 模型Qwen3.5-9B配上 little-coder 的脚手架后解出45.6%的题目而同一模型的普通编码智能体只有19.1%——甚至逼近了 gpt-4.5-preview44.9%这类前沿大模型的成绩。整套实验只跑在一台消费级笔记本上RTX 5070 Laptop8GB 显存没有任何云端推理。结论先摆在这模型不变只改脚手架性能翻倍。这个脚手架的零件就是下面要讲的技能卡片。️ 技能卡片是什么30 份即插即用的 Markdown 小抄little-coder 把所有外挂知识都写成了纯 Markdown 文件放在 skills/ 目录下共 30 份分三类目录数量管什么skills/tools/14 张工具使用卡read/edit/bash/dispatch等工具的正确姿势skills/knowledge/13 张算法小抄动态规划、二分查找、双指针、回溯等skills/protocols/3 份研究协议先取证再回答、任务分解等工作流每张卡片就是一个很小的 md 文件头部带一段名片元数据frontmatter声明它是给哪个工具的、命中哪些关键词、以及注入它要花多少token 成本。以 skills/knowledge/dynamic_programming.md 为例成本 110 token挂了dp、memoize、knapsack、longest subsequence等 13 个关键词正文只有一小段何时用动态规划的判据。这正是小模型友好的设计单张卡只有几十到一百多 token模型看得懂、读得起人也能直接读文件做审计。 算法知识注入按题打分只送最相关的小抄光有卡片库不够关键是每一轮该送哪几张。.pi/extensions/knowledge-inject/ 这个扩展在每轮开始时装了个评分器流程只有三步打分把你的题目文字和每张卡的关键词表逐一比对——单个词命中 1.0 分双词短语命中 2.0 分过滤得分低于 2.0 的卡片直接出局避免什么都送预算装箱在约 200 token 的预算内按分数从高到低挑选打包成一个## Algorithm Reference块举个例子题目里出现 find the minimum cost 和 number of ways就会命中 dynamic_programming.md 的关键词DP 小抄自动送达而提到 sorted、sliding window 的题目则会收到 two_pointers.md组合生成类题目收到 recursion_backtracking.md。卡片库里甚至有树重根tree re-rooting这种相当细的技巧tree_rerooting.md。注意定位项目给模型的系统提示 AGENTS.md 里明确写着这些小抄是小而针对性的学习辅助模型应当信任、但不许照本宣科。️ 工具技能卡片按错误 最近 意图三优先级自动挑卡算法卡管思路工具卡管手。.pi/extensions/skill-inject/ 负责在约 300 token 预算内挑工具卡优先级顺序很有讲究错误恢复上一个工具调用失败了就先把那个工具的卡送上去。比如edit报String not foundedit.md 卡片里专门写了怎么修重新read拿准空白字符、补上下文让匹配唯一而不是退回write重写整个文件最近性最近 8 次调用过的工具卡片优先入选意图猜测从提示词猜你接下来要干什么——read / fix / replace 指向读写类工具train / build / serve 这类长跑任务则指向 shell_start.md 后台任务卡用户也可以接管这个选择器输入/skills查看当前加载了哪些卡、各花多少 token/skills edit强制钉住某一张/skills off恢复自动选择。想深入了解某张卡的写法直接看 skills/tools/read.md 这类文件即可。 关键细节小抄放在对话末尾而不是系统提示为什么不干脆把所有知识塞进系统提示因为对本地推理来说系统提示一变KV 缓存前缀就作废服务器得把整个对话历史重新算一遍——长对话下这是致命的浪费。little-coder 的解法README.md 的故障排查一节有完整记录是把技能卡与知识块作为一条位于对话末尾的普通消息发送而不是追加到系统提示。这样请求前缀保持逐字节一致缓存命中率能稳定在 99.8% 左右终端状态栏里的CH字段可以直接验证。还有一层防重复机制如果这一轮挑出的小抄和上一轮完全相同就不重复发送——反正上一份还留在对话里重发只会白白烧掉小模型宝贵的上下文窗口。 逐语言成绩六种语言全面领先分语言看差距同样稳定Python 52.9%、Java 52.1%、C 50.0%、JavaScript 46.9%、Go 38.5%、Rust 30.0%每种语言都是同模型基线的两倍以上。对一个跑在 8GB 显存上的 9.7B 模型来说这不是某道题的运气而是系统性的抬升。 自己动手从哪里读起完整文档README.md —— 安装、本地模型部署、模型配置都在这里系统提示AGENTS.md —— 定义了模型每一轮会收到哪些指导块基准测试细节docs/benchmark-baseline-aider.md卡片库本体skills/ —— 30 份全是纯 Markdown可以直接通读小结给小模型装外挂小抄的方法论其实就三条知识拆小把工具和算法知识写成几十 token 的小卡片标注关键词与成本skills/按需选择用简单的打分 预算规则每轮只送最相关的卡片.pi/extensions/knowledge-inject/ 与 .pi/extensions/skill-inject/注入位置聪明放在对话末尾、不破坏 KV 缓存、内容不变就不重发模型一个参数都没动每轮多花两三百 token 的小抄换来 2.4 倍的解题率——这就是 little-coder 想证明的事脚手架工程本身就是一种能力。【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coder创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表