Auto-Formulating Dynamic Programming Problems with Large Language Models

发布时间:2026/10/4 14:21:39
Auto-Formulating Dynamic Programming Problems with Large Language Models 文章主要内容总结本文聚焦于利用大型语言模型(LLMs)实现动态规划(DP)问题的自动建模,旨在解决传统DP建模依赖专家知识、现有LLM方法在DP任务中表现不佳的问题。主要内容包括:问题背景:DP作为运筹学中的核心方法,其建模涉及多阶段决策和随机过渡,且现实场景中的DP问题常嵌入自然语言描述,包含隐含假设和领域术语,导致LLM自动建模难度大;同时,缺乏标准化的DP评估基准,阻碍了模型性能的系统验证。核心方法:提出DP-Bench:首个标准化DP基准,包含132个教材级问题(90个简单、42个困难),覆盖确定性/随机性、有限/无限 horizon等场景,用于评估LLM从自然语言到数学模型的转化能力。开发DPLM:基于开源模型微调的7B参数专用模型,通过合成数据训练,性能接近甚至超越更大规模的SOTA模型(如OpenAI的o1、DeepSeek-R1),尤其在困难问题上表现更优。设计DualReflect:双方向合成数据生成框架,结合“正向生成”(先造问题再求解,保证多样性)和“反向生成”(从解反推问题,保证可靠性),并通过“Reflected CoT”机制修复不一致样本,从91个种子样本扩展到113K训练数据。实验结果:DPLM在DP-Bench上的简单问题准确率达65.6%,困难问题达38.1%,超过其教师模型GPT-4o及其他开源小