ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Exploring the Potential and Limitations of Large Language Models for Novice Program Fault Localiz...

Exploring the Potential and Limitations of Large Language Models for Novice Program Fault Localiz... 文章主要内容与创新点总结一、主要内容该研究聚焦新手程序员代码故障定位问题,针对传统故障定位方法(如SBFL、MBFL)缺乏代码上下文理解能力的局限,系统评估了13个大语言模型(6个闭源模型、7个开源模型)在该任务中的表现。研究采用Codeflaws、Condefects两个公开数据集,并构建了无数据泄露风险的BugT新数据集,通过Top-N指标、消融实验、用户问卷等方法,从模型性能、提示工程影响、问题难度适配性、解释质量等维度展开分析。核心发现包括:闭源模型(如OpenAI o3)和专为代码任务优化的开源模型(如DeepSeekR1)整体性能优于传统方法,能提供上下文感知的故障定位结果及解释;具备强推理能力的模型(如OpenAI o3、DeepSeekR1)对提示工程依赖度低,而推理能力较弱的模型(如GPT-4)需精心设计提示;模型准确率随问题难度上升而下降,但顶级模型在BugT数据集上即使面对高难度任务仍保持稳健性能;大语言模型的故障解释对新手程序员具有显著教育价值,尤其受1年编程经验的学习者认可;大语言模型存在过度推理、部署成本高的问题,且不同方法在故障类型识别上具有互补性。二、创新点全面的模型评估:扩展了8个新增模型(4个前沿闭源模型、4个主流开源模型),覆盖不同架构类型,系统对比闭源与开源模型在新手代码故障定位中的表现;新数据集构建:创
返回列表