Science-T2I: Addressing Scientific Illusions in Image Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jialuo, Chai, Wenhao, Fu, Xingyu, Xu, Haiyang, Xie, Saining |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoNSA: Native Sparse Attention Scales Video Understanding
par: Song, Enxin, et autres
Publié: (2025)
par: Song, Enxin, et autres
Publié: (2025)
Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
par: Li, Jialuo, et autres
Publié: (2025)
par: Li, Jialuo, et autres
Publié: (2025)
Transition Matching Distillation for Fast Video Generation
par: Nie, Weili, et autres
Publié: (2026)
par: Nie, Weili, et autres
Publié: (2026)
Do you see what I see? An Ambiguous Optical Illusion Dataset exposing limitations of Explainable AI
par: Newen, Carina, et autres
Publié: (2025)
par: Newen, Carina, et autres
Publié: (2025)
Improved Baselines with Representation Autoencoders
par: Singh, Jaskirat, et autres
Publié: (2026)
par: Singh, Jaskirat, et autres
Publié: (2026)
Traveling Across Languages: Benchmarking Cross-Lingual Consistency in Multimodal LLMs
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Camouflaged Image Synthesis Is All You Need to Boost Camouflaged Detection
par: Zhang, Haichao, et autres
Publié: (2023)
par: Zhang, Haichao, et autres
Publié: (2023)
Leveraging Geometric Visual Illusions as Perceptual Inductive Biases for Vision Models
par: Yang, Haobo, et autres
Publié: (2025)
par: Yang, Haobo, et autres
Publié: (2025)
CycleNet: Rethinking Cycle Consistency in Text-Guided Diffusion for Image Manipulation
par: Xu, Sihan, et autres
Publié: (2023)
par: Xu, Sihan, et autres
Publié: (2023)
MoDE: CLIP Data Experts via Clustering
par: Ma, Jiawei, et autres
Publié: (2024)
par: Ma, Jiawei, et autres
Publié: (2024)
What matters for Representation Alignment: Global Information or Spatial Structure?
par: Singh, Jaskirat, et autres
Publié: (2025)
par: Singh, Jaskirat, et autres
Publié: (2025)
SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
par: Chu, Tianzhe, et autres
Publié: (2025)
par: Chu, Tianzhe, et autres
Publié: (2025)
T2I-ConBench: Text-to-Image Benchmark for Continual Post-training
par: Huang, Zhehao, et autres
Publié: (2025)
par: Huang, Zhehao, et autres
Publié: (2025)
Label-free Neural Semantic Image Synthesis
par: Wang, Jiayi, et autres
Publié: (2024)
par: Wang, Jiayi, et autres
Publié: (2024)
PackDiT: Joint Human Motion and Text Generation via Mutual Prompting
par: Jiang, Zhongyu, et autres
Publié: (2025)
par: Jiang, Zhongyu, et autres
Publié: (2025)
The Illusion of Forgetting: Attack Unlearned Diffusion via Initial Latent Variable Optimization
par: Li, Manyi, et autres
Publié: (2026)
par: Li, Manyi, et autres
Publié: (2026)
Unlocking Pre-trained Image Backbones for Semantic Image Synthesis
par: Berrada, Tariq, et autres
Publié: (2023)
par: Berrada, Tariq, et autres
Publié: (2023)
Addressing Negative Transfer in Diffusion Models
par: Go, Hyojun, et autres
Publié: (2023)
par: Go, Hyojun, et autres
Publié: (2023)
Generalizable Geometric Image Caption Synthesis
par: Xin, Yue, et autres
Publié: (2025)
par: Xin, Yue, et autres
Publié: (2025)
InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs
par: Tang, Lv, et autres
Publié: (2026)
par: Tang, Lv, et autres
Publié: (2026)
ATLAS: Adapter-Based Multi-Modal Continual Learning with a Two-Stage Learning Strategy
par: Li, Hong, et autres
Publié: (2024)
par: Li, Hong, et autres
Publié: (2024)
Accessing Vision Foundation Models via ImageNet-1K
par: Zhang, Yitian, et autres
Publié: (2024)
par: Zhang, Yitian, et autres
Publié: (2024)
Adaptive Training Meets Progressive Scaling: Elevating Efficiency in Diffusion Models
par: Li, Wenhao, et autres
Publié: (2023)
par: Li, Wenhao, et autres
Publié: (2023)
H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers
par: Li, Wenhao, et autres
Publié: (2025)
par: Li, Wenhao, et autres
Publié: (2025)
Improving Diffusion-Based Image Synthesis with Context Prediction
par: Yang, Ling, et autres
Publié: (2024)
par: Yang, Ling, et autres
Publié: (2024)
ProTIP: Probabilistic Robustness Verification on Text-to-Image Diffusion Models against Stochastic Perturbation
par: Zhang, Yi, et autres
Publié: (2024)
par: Zhang, Yi, et autres
Publié: (2024)
ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion
par: Fang, Zhenghan, et autres
Publié: (2025)
par: Fang, Zhenghan, et autres
Publié: (2025)
AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment
par: Kao, Kuei-Chun, et autres
Publié: (2026)
par: Kao, Kuei-Chun, et autres
Publié: (2026)
High-Resolution Image Synthesis via Next-Token Prediction
par: Chen, Dengsheng, et autres
Publié: (2024)
par: Chen, Dengsheng, et autres
Publié: (2024)
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
par: Zhou, Guanyu, et autres
Publié: (2026)
par: Zhou, Guanyu, et autres
Publié: (2026)
Beyond Visual Fidelity: Benchmarking Super-Resolution Models for Large-Scale Remote Sensing Imagery via Downstream Task Integration
par: Li, Zhili, et autres
Publié: (2026)
par: Li, Zhili, et autres
Publié: (2026)
SegGen: Supercharging Segmentation Models with Text2Mask and Mask2Img Synthesis
par: Ye, Hanrong, et autres
Publié: (2023)
par: Ye, Hanrong, et autres
Publié: (2023)
When are Foundation Models Effective? Understanding the Suitability for Pixel-Level Classification Using Multispectral Imagery
par: Xie, Yiqun, et autres
Publié: (2024)
par: Xie, Yiqun, et autres
Publié: (2024)
BIP3D: Bridging 2D Images and 3D Perception for Embodied Intelligence
par: Lin, Xuewu, et autres
Publié: (2024)
par: Lin, Xuewu, et autres
Publié: (2024)
Editing Massive Concepts in Text-to-Image Diffusion Models
par: Xiong, Tianwei, et autres
Publié: (2024)
par: Xiong, Tianwei, et autres
Publié: (2024)
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
par: Izadi, Amirmohammad, et autres
Publié: (2025)
par: Izadi, Amirmohammad, et autres
Publié: (2025)
STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis
par: Gu, Jiatao, et autres
Publié: (2025)
par: Gu, Jiatao, et autres
Publié: (2025)
Improved Sub-Visible Particle Classification in Flow Imaging Microscopy via Generative AI-Based Image Synthesis
par: Ozbulak, Utku, et autres
Publié: (2025)
par: Ozbulak, Utku, et autres
Publié: (2025)
TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models
par: Zhou, Wenhao, et autres
Publié: (2025)
par: Zhou, Wenhao, et autres
Publié: (2025)
Leveraging Image Generators to Address Training Data Scarcity: The Gen4Regen Dataset for Forest Regeneration Mapping
par: Jeanson, Gabriel, et autres
Publié: (2026)
par: Jeanson, Gabriel, et autres
Publié: (2026)
Documents similaires
-
VideoNSA: Native Sparse Attention Scales Video Understanding
par: Song, Enxin, et autres
Publié: (2025) -
Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
par: Li, Jialuo, et autres
Publié: (2025) -
Transition Matching Distillation for Fast Video Generation
par: Nie, Weili, et autres
Publié: (2026) -
Do you see what I see? An Ambiguous Optical Illusion Dataset exposing limitations of Explainable AI
par: Newen, Carina, et autres
Publié: (2025) -
Improved Baselines with Representation Autoencoders
par: Singh, Jaskirat, et autres
Publié: (2026)