Tasks over Application Manuals: Revealing Gaps in Long-Horizon Procedural Reasoning for Language Models
研究通过构建TAM基准,评估大型语言模型在遵循复杂、长篇幅应用手册执行多步骤任务的能力,揭示了现有模型在此类长期程序推理上的不足。
0 citationsRead paper
研究通过构建TAM基准,评估大型语言模型在遵循复杂、长篇幅应用手册执行多步骤任务的能力,揭示了现有模型在此类长期程序推理上的不足。
研究解决了LLM代理在技能检索中的灾难性遗忘问题,通过使用持续学习启发的方法如嵌入锚正则化等,改善了合成数据和真实数据上的技能检索性能。
论文提出控制-数据流分离方法,解决多代理LLM系统中提示优化导致协议失效问题,通过将执行关键控制与任务相关语言分离,提高系统性能。
研究通过构建TAM基准,评估大型语言模型在遵循复杂、长篇幅应用手册执行多步骤任务的能力,揭示了现有模型在此类长期程序推理上的不足。
研究解决了LLM代理在技能检索中的灾难性遗忘问题,通过使用持续学习启发的方法如嵌入锚正则化等,改善了合成数据和真实数据上的技能检索性能。
论文提出控制-数据流分离方法,解决多代理LLM系统中提示优化导致协议失效问题,通过将执行关键控制与任务相关语言分离,提高系统性能。