ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

数据不说谎:Token Optimizer 受控 A/B 基准测试方法论与 87 个 Fixture 测试套件完整剖析

数据不说谎:Token Optimizer 受控 A/B 基准测试方法论与 87 个 Fixture 测试套件完整剖析 数据不说谎Token Optimizer 受控 A/B 基准测试方法论与 87 个 Fixture 测试套件完整剖析【免费下载链接】token-optimizerFind the ghost tokens. Fix them. Survive compaction. Avoid context quality decay.项目地址: https://gitcode.com/gh_mirrors/toke/token-optimizerToken Optimizer 是一款开源的 AI 编程助手 Token 压缩与上下文优化工具它把冗长的命令输出、日志和构建结果在后台自动压缩帮你省 Token、省费用、撑过长会话。但省了 Token这种结论最容易被夸大宣传污染——本文带你拆解它背后的受控 A/B 基准测试方法论和 87 个 Fixture 压缩安全测试套件看看每一个节省数字到底是怎么测出来的。为什么省 Token需要受控实验市面上的省 Token宣传往往给出一个模糊的平均节省 X%。但不同会话的可压缩内容差异巨大一个满是git、grep输出的会话能省一大截而一段纯聊天几乎无可压缩。Token Optimizer 的做法很克制它把三个视角分开呈现、从不互相相加——受控 A/B 实验同一任务开/关插件各跑 20 次隔离测量单一机制CONTROLLED-A-B-BENCHMARK.md30 天真实使用报告一位用户一个月的真实账单数据BENCHMARK.md️87 个 Fixture 测试套件验证压缩本身不丢关键信息受控 A/B 基准测试四个关键步骤第一步只改变一个变量。同一个固定任务在全新隔离目录中运行插件开启 20 次、关闭 20 次两侧交错执行每侧先弃掉 1 次预热运行。既然唯一变量就是插件本身任何差异都只能来自它。第二步以真实账单为准Ground Truth。不读插件自己的仪表盘而是直接从 Claude 的会话转录中读取真实计费 Token 数按 input / cache-read / cache-creation 三类分别累加并按消息去重——同一条助手消息绝不会被重复计数。第三步两层验证。A 层测量被压缩的那段工具输出的体积证明机制确实触发了B 层测量整个会话的输入足迹这才是真正被计费的节省——因为更小的工具结果还会连带缩小后续每一轮被重复计费的上下文。第四步无损检验No-harm check。每次运行结束后向模型提问答案就埋在压缩后的输出里。如果所谓的节省是靠让模型变瞎换来的这一步会当场抓住它并作废该次结果。实验配置为 Claude Haiku 4.5并在 Sonnet 5 上交叉验证凡两侧工作量不等价的运行会在对比前被隔离剔除。四组实测数据哪些场景真的省了问题A/B 设置结果解读会向轻会话收税吗无内容可压缩的新会话约160 Token0.5%无害轻会话不被加税命令密集型工作省吗git status/diff/logls -la−11% Token/ −19%美元估算干净省钱理解度 100%Sonnet 5 上 −10.7% 同样成立搜索密集型工作省吗一次返回 480 条匹配的grep−15.7% Token干净省钱计数与定位问题 100% 答对重复读取省吗读文件 → 编辑 → 再读结论待定如实报告为测量缺口不做主张注意一个诚实的细节重读场景直接标注Inconclusive而不是硬编一个数字。另外报告也明确列出了这套 A/B测不到的部分模型路由、缓存失效避免、人工审计建议因为这些结构性节省无法被固定模型、短会话的实验观察到——所以每组数字应读作可证明的地板而非承诺。87 个 Fixture 测试套件压缩前的安全体检单省 Token 是手段不弄丢关键信息才是底线。在信任压缩处理真实输出之前仓库内置了87 个 Fixture、覆盖 22 个类别、全部通过的测试套件入口在 benchmark.py。每个 Fixture 都定义四样东西三者全满足才算通过raw_output一段逼真的原始 CLI 输出输入must_preserve必须保留的关键信息清单如分支名、提交数、失败测试名must_not_contain不得出现的字符串清单专门抓幻觉比如把 CVE 编号误造成 lint 规则码min_compression最低压缩率要求压缩不够没省到也算失败类别分布摘自 BENCHMARK.md类别数量测试内容test_exts10各扩展名的测试运行器Playwright、Gradle、Tox、Bun、Deno…build8cargo、make、webpack、tsc、gradlegit / lint / logs7×3status/log/合并冲突eslint、ruff、clippynginx、docker、systemd 日志tee_on_failure5失败命令必须保留完整原始输出json / csv / stack_trace / cloud_cli / search_results4×5保值结构化压缩 security3AWS 密钥、GitHub PAT、Slack Token绝不允许被剥除⚠️ error2非零退出、权限拒绝必须原样透传三条承重护栏密钥、错误与失败输出安全类、错误类和 tee_on_failure 类是整套套件的承重墙——压缩永远不允许让你失去一个凭证、一条错误信息或一条失败命令的输出。翻看 benchmark.py 里的 Fixture 设计能感受到对抗性测试的密度密钥藏在 lint 报告、日志、文件名、OSC 8 超链接、JWT、数据库连接串里——压缩后必须原样存活荷兰语错误行、德语/中文 stderr 都会触发失败透传非英文报错同样不压缩Found 0 errors 不能把 10 个真错误误判成干净构建真正的错误行里恰好写着 no errors 也不能被吞失败判定逻辑集中在run_single_fixturebenchmark.py保留性、压缩率、负向断言三关全过才算pass任何一关失守都会打印具体缺失项。数据分级Measured、Estimated 与 OpportunityToken Optimizer 从不把不同置信度的数字混成一个总数而是三级标注层级含义例子 Measured逐事件直接计量带前后 Token 数工具输出归档、Bash 压缩 Estimated基于已发生事件建模单独列出避免的重复读取、精简会话恢复⚪ Opportunity需你采纳建议才兑现永不计入标题数字结构性瘦身建议还有一处自证清白的细节基准测试框架自己跑测试产生的事件本窗口内 766 条标记为f3bench-session-0001等会被从所有报告数字中剔除——测试数据不会污染真实账单。三步复跑在你自己的数据上验证所有数字都能对着你自己的会话历史重新生成方法在 BENCHMARK.md 中完整公开python3 scripts/benchmark.py—— 跑 87 个 Fixture 的确定性压缩安全套件python3 scripts/measure.py dashboard—— 生成你自己的三级节省仪表盘python3 scripts/measure.py savings --json—— 查看每一分节省背后的事件账本此外仓库还附带一个压缩时机评估器用 30 个合成会话、120 个检查点测量何时建议 compact 才安全docs/evals/README.md并明确要求合成数据只验证评估器行为改运行时策略必须用私有真实数据。数据不说谎前提是测量方法本身经得起审视。受控 A/B 证明省得干净、不伤理解87 个 Fixture 证明省得安全分级账本证明每一分都查得到出处——这套组合正是普通用户判断一个 Token 压缩工具是否值得信任的最好标尺。✅【免费下载链接】token-optimizerFind the ghost tokens. Fix them. Survive compaction. Avoid context quality decay.项目地址: https://gitcode.com/gh_mirrors/toke/token-optimizer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表