StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision
Fuente:
arXiv
Salvato in:
| Autori principali: | Lyu, Yuanhuiyi, Lei, Kaiyu, Weng, Ziqiao, Zheng, Xu, Jiang, Lutao, Li, Teng, Li, Yangfu, Huang, Ziyuan, Zhang, Linfeng, Hu, Xuming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PANORAMA: The Rise of Omnidirectional Vision in the Embodied AI Era
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
Retrieval Augmented Generation and Understanding in Vision: A Survey and New Outlook
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
RealRAG: Retrieval-augmented Realistic Image Generation via Self-reflective Contrastive Learning
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
MAGIC++: Efficient and Resilient Modality-Agnostic Semantic Segmentation via Hierarchical Modality Selection
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
BrightDreamer: Generic 3D Gaussian Generative Framework for Fast Text-to-3D Synthesis
di: Jiang, Lutao, et al.
Pubblicazione: (2024)
di: Jiang, Lutao, et al.
Pubblicazione: (2024)
TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders
di: Li, Teng, et al.
Pubblicazione: (2026)
di: Li, Teng, et al.
Pubblicazione: (2026)
Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
Perceptual Flow Network for Visually Grounded Reasoning
di: Li, Yangfu, et al.
Pubblicazione: (2026)
di: Li, Yangfu, et al.
Pubblicazione: (2026)
Learning Robust Anymodal Segmentor with Unimodal and Cross-modal Distillation
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
Reducing Unimodal Bias in Multi-Modal Semantic Segmentation with Multi-Scale Functional Entropy Regularization
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
CompoNeRF: Text-guided Multi-object Compositional NeRF with Editable 3D Scene Layout
di: Bai, Haotian, et al.
Pubblicazione: (2023)
di: Bai, Haotian, et al.
Pubblicazione: (2023)
Image Anything: Towards Reasoning-coherent and Training-free Multi-modal Image Generation
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
EgoIntent: An Egocentric Step-level Benchmark for Understanding What, Why, and Next
di: Pan, Ye, et al.
Pubblicazione: (2026)
di: Pan, Ye, et al.
Pubblicazione: (2026)
SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context
di: Li, Jungang, et al.
Pubblicazione: (2024)
di: Li, Jungang, et al.
Pubblicazione: (2024)
T-Rex-Omni: Integrating Negative Visual Prompt in Generic Object Detection
di: Zhou, Jiazhou, et al.
Pubblicazione: (2025)
di: Zhou, Jiazhou, et al.
Pubblicazione: (2025)
Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
MLLMs are Deeply Affected by Modality Bias
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
di: Zou, Xin, et al.
Pubblicazione: (2025)
di: Zou, Xin, et al.
Pubblicazione: (2025)
OmniSAM: Omnidirectional Segment Anything Model for UDA in Panoramic Semantic Segmentation
di: Zhong, Ding, et al.
Pubblicazione: (2025)
di: Zhong, Ding, et al.
Pubblicazione: (2025)
DiMeR: Disentangled Mesh Reconstruction Model
di: Jiang, Lutao, et al.
Pubblicazione: (2025)
di: Jiang, Lutao, et al.
Pubblicazione: (2025)
PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs
di: Zhang, Zixin, et al.
Pubblicazione: (2025)
di: Zhang, Zixin, et al.
Pubblicazione: (2025)
ExACT: Language-guided Conceptual Reasoning and Uncertainty Estimation for Event-based Action Recognition and More
di: Zhou, Jiazhou, et al.
Pubblicazione: (2024)
di: Zhou, Jiazhou, et al.
Pubblicazione: (2024)
A General Framework to Boost 3D GS Initialization for Text-to-3D Generation by Lexical Richness
di: Jiang, Lutao, et al.
Pubblicazione: (2024)
di: Jiang, Lutao, et al.
Pubblicazione: (2024)
StruProKGR: A Structural and Probabilistic Framework for Sparse Knowledge Graph Reasoning
di: Guo, Yucan, et al.
Pubblicazione: (2025)
di: Guo, Yucan, et al.
Pubblicazione: (2025)
Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
EIT-1M: One Million EEG-Image-Text Pairs for Human Visual-textual Recognition and More
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
From Reusing to Forecasting: Accelerating Diffusion Models with TaylorSeers
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
Learning Modality-agnostic Representation for Semantic Segmentation from Any Modalities
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
StruSR: Structure-Aware Symbolic Regression with Physics-Informed Taylor Guidance
di: Gong, Yunpeng, et al.
Pubblicazione: (2025)
di: Gong, Yunpeng, et al.
Pubblicazione: (2025)
MMUnlearner: Reformulating Multimodal Machine Unlearning in the Era of Multimodal Large Language Models
di: Huo, Jiahao, et al.
Pubblicazione: (2025)
di: Huo, Jiahao, et al.
Pubblicazione: (2025)
Deep Image prior with StruCtUred Sparsity (DISCUS) for dynamic MRI reconstruction
di: Sultan, Muhammad A., et al.
Pubblicazione: (2023)
di: Sultan, Muhammad A., et al.
Pubblicazione: (2023)
zkStruDul: Programming zkSNARKs with Structural Duality
di: Krishnan, Rahul, et al.
Pubblicazione: (2025)
di: Krishnan, Rahul, et al.
Pubblicazione: (2025)
StruQ: Defending Against Prompt Injection with Structured Queries
di: Chen, Sizhe, et al.
Pubblicazione: (2024)
di: Chen, Sizhe, et al.
Pubblicazione: (2024)
A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges
di: Yan, Yibo, et al.
Pubblicazione: (2024)
di: Yan, Yibo, et al.
Pubblicazione: (2024)
SpeCa: Accelerating Diffusion Transformers with Speculative Feature Caching
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
VisTIRA: Closing the Image-Text Modality Gap in Visual Math Reasoning via Structured Tool Integration
di: Khaki, Saeed, et al.
Pubblicazione: (2026)
di: Khaki, Saeed, et al.
Pubblicazione: (2026)
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
di: Li, Yangfu, et al.
Pubblicazione: (2026)
di: Li, Yangfu, et al.
Pubblicazione: (2026)
MemorySAM: Memorize Modalities and Semantics with Segment Anything Model 2 for Multi-modal Semantic Segmentation
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language Reasoning
di: Li, Rongjie, et al.
Pubblicazione: (2024)
di: Li, Rongjie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PANORAMA: The Rise of Omnidirectional Vision in the Embodied AI Era
di: Zheng, Xu, et al.
Pubblicazione: (2025) -
Retrieval Augmented Generation and Understanding in Vision: A Survey and New Outlook
di: Zheng, Xu, et al.
Pubblicazione: (2025) -
RealRAG: Retrieval-augmented Realistic Image Generation via Self-reflective Contrastive Learning
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025) -
MAGIC++: Efficient and Resilient Modality-Agnostic Semantic Segmentation via Hierarchical Modality Selection
di: Zheng, Xu, et al.
Pubblicazione: (2024) -
BrightDreamer: Generic 3D Gaussian Generative Framework for Fast Text-to-3D Synthesis
di: Jiang, Lutao, et al.
Pubblicazione: (2024)