
一、文章主要内容总结该研究聚焦水利科学与工程(Hydro-SE)领域,针对大型语言模型(LLMs)在该领域的知识储备与应用能力缺乏系统评估的问题,提出了首个全面的评估基准Hydro-SE Bench。基准构建:包含4000道选择题(68%单选题、32%多选题),覆盖水利科学与工程的9个核心子领域(如水文水资源、岩土工程、水力结构与设备等),并按任务类型分为基础概念知识(A类)、工程应用(B类)、推理与计算(C类)三类,确保评估的全面性。题目来源涵盖教材、行业标准、法律法规等权威资料,经多轮专家审核确保质量。模型评估:对10个大参数商业LLM和6个小参数开源LLM进行系统测试,核心结果包括:商业LLM整体准确率为0.74-0.80,开源小参数模型为0.41-0.68,存在显著性能差距;模型在自然科学和物理科学相关子领域(如电力系统、气象学、水力学与河流动力学)表现优异,在行业标准、工程安全管理等依赖专业术语和动态更新知识的领域表现薄弱;参数规模扩大主要提升推理与计算能力(商业模型较开源模型平均提升56.0%),对基础概念和工程应用的提升有限(分别为23.4%和32.7%);部分模型存在置信度校准偏差,开源模型易高估自身答案正确性,商业模型校准性能更优但仍有改进空间。实用价值:验证了Hydro-SE Bench的难度一致性,推荐30%的采样比例可实现高效评估;为模型开发