ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

RAG知识库 B评估实验结果报告

RAG知识库 B评估实验结果报告 数据库 B实验结果报告第一章 实验概述1.1 实验背景与目标本实验面向论文检索场景评估不同检索策略在给定语料库共171 篇学术文献上的检索质量。语料按主题分为三类漏洞修复20 篇、漏洞检测93 篇、LLM 安全58 篇三类论文数之和恰为 171 篇构成完整的测试语料。1.2 测试查询测试集包含 3 条英文查询分别与上述三个主题类别一一对应序号测试查询英文对应主题类别相关文献数1State-of-the-art source code automatic repair methods漏洞修复20篇202Summarize automated vulnerability mining frameworks漏洞检测93篇933Future trends of LLM security researchLLM安全58篇581.3 评估指标定义检索正例在返回结果TOP-K中被判定为与查询相关的文献数。RecallK召回率 检索正例数 ÷ 该类别相关文献总数。衡量“该找的找到了多少”。PrecisionK准确率 检索正例数 ÷ TOP-K实际返回数。衡量“返回的结果有多少是对的”。F1K 2 × Recall × Precision ÷ (Recall Precision)。综合权衡召回与准确作为核心择优指标。第二章 实验设计与配置实验覆盖 4 种检索方式并在每种方式下扫描多组超参数重排序模型 / 融合权重、TOP-K、Score 阈值检索方式重排序 / 融合策略配置组数TOP-K 取值Score 阈值取值全文检索重排序模型 bge-reranker-v2-m3123 / 5 / 8 / 100 / 0.5 / 0.8向量检索bge-reranker-v2-m3123 / 5 / 8 / 100 / 0.5 / 0.8混合检索-Rerank重排序模型 bge-reranker-v2-m3123 / 5 / 8 / 100 / 0.5 / 0.8混合检索-权重设置语义:关键词 权重 0:100% ~ 100%:0 共12档443 / 5 / 8 / 100 / 0.5 / 0.8第三章 核心指标汇总下表给出各检索方式在全部超参数组合中的最优配置及其核心指标F1K 最高者检索方式最优配置召回率准确率F1K均值F1全文检索变体bge-rerankerTOP-K10Score阈值0.06.43%36.67%10.95%3.34%向量检索变体bge-rerankerTOP-K10Score阈值0.016.96%96.67%28.86%8.68%混合检索-Rerank变体bge-rerankerTOP-K10Score阈值0.012.87%73.33%21.89%7.47%混合检索-权重设置变体0.40.6TOP-K10Score阈值0.017.54%100.00%29.85%18.08%第四章 各检索方式性能表现4.1 全文检索配置组数12最优配置变体bge-rerankerTOP-K10Score阈值0.0。整体指标最优配置RecallK 6.43%PrecisionK 36.67%F1K 10.95%。分主题类别表现主题类别相关文献检索正例RecallKPrecisionKF1K漏洞修复20735.00%70.00%46.67%漏洞检测9344.30%40.00%7.77%LLM安全5800.00%0.00%—整体平均全配置Recall 1.90%Precision 15.79%F1 3.34%。4.2 向量检索配置组数12最优配置变体bge-rerankerTOP-K10Score阈值0.0。整体指标最优配置RecallK 16.96%PrecisionK 96.67%F1K 28.86%。分主题类别表现主题类别相关文献检索正例RecallKPrecisionKF1K漏洞修复201050.00%100.00%66.67%漏洞检测9399.68%90.00%17.48%LLM安全581017.24%100.00%29.41%整体平均全配置Recall 4.09%Precision 36.06%F1 8.68%。4.3 混合检索-Rerank配置组数12最优配置变体bge-rerankerTOP-K10Score阈值0.0。整体指标最优配置RecallK 12.87%PrecisionK 73.33%F1K 21.89%。分主题类别表现主题类别相关文献检索正例RecallKPrecisionKF1K漏洞修复201050.00%100.00%66.67%漏洞检测9366.45%60.00%11.65%LLM安全58610.34%60.00%17.65%整体平均全配置Recall 4.24%Precision 36.04%F1 7.47%。4.4 混合检索-权重设置配置组数44最优配置变体0.40.6TOP-K10Score阈值0.0。整体指标最优配置RecallK 17.54%PrecisionK 100.00%F1K 29.85%。分主题类别表现主题类别相关文献检索正例RecallKPrecisionKF1K漏洞修复201050.00%100.00%66.67%漏洞检测931010.75%100.00%19.42%LLM安全581017.24%100.00%29.41%整体平均全配置Recall 10.23%Precision 89.89%F1 18.08%。4.5 混合检索-权重设置的权重敏感度B库在 TOP-K10、Score阈值0 条件下不同语义:关键词权重下的 F1K 峰值配置权重(语义:关键词)召回率准确率F1K0.40.617.54%100.00%29.85%0.30.716.96%96.67%28.86%0.20.816.37%93.33%27.86%0.50.516.37%93.33%27.86%0.60.416.37%93.33%27.86%第五章 关键发现Score 阈值对召回存在显著负向影响。所有检索方式下Score 阈值取 0.5 或 0.8 的配置其召回率与 F1 普遍大幅低于阈值0 的配置全部最优指标均出现在 Score 阈值0 处。建议在保证准确率可接受的前提下将阈值设为 0。TOP-K 与检索质量正相关。以最优配置集中的 TOP-K10 为例其召回率与 F1 明显高于 TOP-K3/5/8增大返回窗口能提升相关文献被覆盖的概率但需权衡下游重排序/阅读成本。“混合检索-权重设置”在本库中综合表现最佳。其峰值 F1K 达 29.85%整体均值 F118.08%显著高于其余三种方式全文/向量/混合-Rerank 均值均低于 10%44 组细粒度权重扫描提供了最大寻优空间在 A 库中其峰值 F1 与“向量检索”持平在 B 库中则明显优于“向量检索”。主题类别间表现严重不均衡。漏洞检测类93 篇相关文献基数大、语义分散各方式召回普遍偏低LLM 安全类在部分配置下召回为 0如 B 库全文检索最优配置未检索到任何 LLM 安全文献是检索质量的短板。稳定性方面“混合检索-权重设置”方式的 F1K 变异系数最小对超参数扰动最不敏感工程落地风险最低。第六章 结论与建议首选方案综合 F1 与寻优空间推荐以“混合检索-权重设置”最优权重TOP-K10Score 阈值0作为本库默认检索策略。参数基线默认 TOP-K10、Score 阈值0在准确率要求极高时可适度引入阈值但需以召回损失为代价进行评估。短板治理针对 LLM 安全类与漏洞检测类召回不足建议扩充该类语料、优化嵌入模型或引入查询改写对类别不均衡问题可采用分主题独立检索与加权融合。
返回列表