When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis
研究通过Elo-per-token分析方法评估大型语言模型在开放任务中的性能扩展性,发现初期增长快但逐渐放缓,提出分段策略以提高整体性能。
0 citationsRead paper
研究通过Elo-per-token分析方法评估大型语言模型在开放任务中的性能扩展性,发现初期增长快但逐渐放缓,提出分段策略以提高整体性能。
研究通过Elo-per-token分析方法评估大型语言模型在开放任务中的性能扩展性,发现初期增长快但逐渐放缓,提出分段策略以提高整体性能。