OmniHarness: Harnessing Generalizable Visual Generation via Symbolic Policy Learning

📅 2026-09-13
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
OmniHarness通过符号策略学习解决视觉生成任务中经验泛化不足、反思滞后及知识获取被动的问题,实现通用视觉生成。
📝 Abstract
Unified multimodal large language models (MLLMs) and multi-agent systems have advanced visual generation. However, three limitations remain. (1) Existing methods often distill task-specific experience with limited generalizability. (2) Reflection is often deferred until task completion. (3) Knowledge is often acquired only in response to downstream task demands. To address these limitations, we introduce OmniHarness, a framework for generalizable visual generation via symbolic policy learning. OmniHarness abstracts verified executions into symbolic policies for visual generation task families, capturing shared procedures and applicability conditions while removing instance-specific inputs. The harness instantiates, adapts, and composes these policies for new tasks. Intermediate verification guides refinement and failure recovery during execution. Through self-directed inquiry, OmniHarness autonomously generates and executes practice tasks near its capability limits before downstream objectives are specified. Execution feedback continually refines the policies while model parameters remain fixed. Experiments across six benchmarks, three MLLM backbones, and three visual agent frameworks demonstrate strong performance and continual capability expansion. On ComfyBench's Creative tasks, OmniHarness achieves a 95.0% resolve rate, exceeding the strongest baseline by 27.5 percentage points. Frozen policy snapshots improve existing visual agent systems through plug-and-play reuse.
Problem

Research questions and friction points this paper is trying to address.

Generalizable Visual Generation
Symbolic Policy Learning
Multimodal Large Language Models
Task-specific Experience
Knowledge Acquisition
Innovation

Methods, ideas, or system contributions that make the work stand out.

symbolic policy learning
generalizable visual generation
intermediate verification
self-directed inquiry
continual capability expansion
🔎 Similar Papers
2024-07-15Neural Information Processing SystemsCitations: 2
💼 Related Jobs
No related jobs found.
X
Xu Xu
Beihang University
J
Jinxiu Liu
The Chinese University of Hong Kong
Z
Zhangbo Qiao
Beihang University
Jiaxing Lu
Jiaxing Lu
Beihang University
X
Xiangyu Zhang
Beihang University
Yubin Gu
Yubin Gu
Ph.D. Candidate, Xiamen University
Multi-Modal LearningLow-Level VisionComputer Vision
F
Fangwei Ning
Beihang University
Yan Shi
Yan Shi
Central south university
Heavy metal pollution controlBiocharBiomass-derived function materials and Lignocellulose valorization