SpatialGuard: Harness-Guided Verifiable Spatial Reasoning for Text-to-Image Generation

📅 2026-09-01
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
针对3D空间文本到图像生成中对象关系、遮挡等问题,提出SpatialGuard框架,通过布局引导和视觉对齐等方法提高生成的可控性和准确性。
📝 Abstract
Complex 3D spatial text to image generation requires models to convert natural language into stable visual geometry, not merely semantic appearance. Existing prompt-driven or layout-conditioned methods improve controllability, but often lack an optimizable and verifiable spatial intermediary before visual sampling. As a result, object relations, occlusion, visibility, and camera constraints can decay during multi-round generation. This paper presents SpatialGuard, a structured layout-guided framework for complex 3D spatial text-to-image generation. SpatialGuard parses prompts into image synthesis-oriented 3D layouts through a Spatial Layout Architect, realizes them as visual conditions and candidate images through a Visual Realizer, and uses a Visual Alignment Critic to validate consistency among prompt, layout, and image. To keep constraints stable across iterations, SpatialGuard introduces a Layout Harness that organizes rule constraints, tool invocation, shared knowledge, and feedback loops around the editable layout state. This design turns complex spatial generation from implicit prompt following into a verifiable process of planning, realization, validation, and repair. Comprehensive experiments show that SpatialGuard achieves state-of-the-art performance in complex 3D spatial layout generation and improves spatial faithfulness over existing text-to-image and layout control baselines.
Problem

Research questions and friction points this paper is trying to address.

text-to-image generation
spatial reasoning
layout control
verifiable process
object relations
Innovation

Methods, ideas, or system contributions that make the work stand out.

Structured Layout-Guided Framework
Spatial Layout Architect
Visual Realizer
Visual Alignment Critic
Layout Harness
🔎 Similar Papers
No similar papers found.
💼 Related Jobs
No related jobs found.
Z
Ziyun Qian
College of Intelligent Robotics and Advanced Manufacturing, Fudan University; Fysics Intelligence Technologies Co., Ltd. (Fysics AI)
Zizhi Chen
Zizhi Chen
Fudan university
Pathology Images
Yizhou Liu
Yizhou Liu
MIT
Dynamical systemsStatistical physicsPhysics of living systemsPhysics of AI
M
Mingyang Sun
College of Intelligent Robotics and Advanced Manufacturing, Fudan University; Fysics Intelligence Technologies Co., Ltd. (Fysics AI)
Dingkang Yang
Dingkang Yang
ByteDance
Multimodal LearningGenerative AIEmbodied AI
Lihua Zhang
Lihua Zhang
Wuhan University
computational biologybioinformaticsdata mining