Improving Physical Object State Representation in Text-to-Image Generative Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Tianle, Chakka, Chaitanya, Ghadiyaram, Deepti |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs
par: Chen, Tianle, et autres
Publié: (2025)
par: Chen, Tianle, et autres
Publié: (2025)
Progressive Prompt Detailing for Improved Alignment in Text-to-Image Generative Models
par: Saichandran, Ketan Suhaas, et autres
Publié: (2025)
par: Saichandran, Ketan Suhaas, et autres
Publié: (2025)
FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models
par: Lim, Youngsun, et autres
Publié: (2026)
par: Lim, Youngsun, et autres
Publié: (2026)
A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning
par: Chen, Tianle, et autres
Publié: (2026)
par: Chen, Tianle, et autres
Publié: (2026)
DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers
par: Kim, Dahye, et autres
Publié: (2026)
par: Kim, Dahye, et autres
Publié: (2026)
Concept Steerers: Leveraging K-Sparse Autoencoders for Test-Time Controllable Generations
par: Kim, Dahye, et autres
Publié: (2025)
par: Kim, Dahye, et autres
Publié: (2025)
Swift Sampling: Selecting Temporal Surprises via Taylor Series
par: Kim, Dahye, et autres
Publié: (2026)
par: Kim, Dahye, et autres
Publié: (2026)
What's in a Latent? Leveraging Diffusion Latent Space for Domain Generalization
par: Thomas, Xavier, et autres
Publié: (2025)
par: Thomas, Xavier, et autres
Publié: (2025)
OSCBench: Benchmarking Object State Change in Text-to-Video Generation
par: Han, Xianjing, et autres
Publié: (2026)
par: Han, Xianjing, et autres
Publié: (2026)
Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards
par: Kim, Seungwook, et autres
Publié: (2026)
par: Kim, Seungwook, et autres
Publié: (2026)
$\textit{Revelio}$: Interpreting and leveraging semantic information in diffusion models
par: Kim, Dahye, et autres
Publié: (2024)
par: Kim, Dahye, et autres
Publié: (2024)
Maestro: Self-Improving Text-to-Image Generation via Agent Orchestration
par: Wan, Xingchen, et autres
Publié: (2025)
par: Wan, Xingchen, et autres
Publié: (2025)
Make It Count: Text-to-Image Generation with an Accurate Number of Objects
par: Binyamin, Lital, et autres
Publié: (2024)
par: Binyamin, Lital, et autres
Publié: (2024)
DebiasPI: Inference-time Debiasing by Prompt Iteration of a Text-to-Image Generative Model
par: Bonna, Sarah, et autres
Publié: (2025)
par: Bonna, Sarah, et autres
Publié: (2025)
GenHOI: Generalizing Text-driven 4D Human-Object Interaction Synthesis for Unseen Objects
par: Li, Shujia, et autres
Publié: (2025)
par: Li, Shujia, et autres
Publié: (2025)
Narrowing Information Bottleneck Theory for Multimodal Image-Text Representations Interpretability
par: Zhu, Zhiyu, et autres
Publié: (2025)
par: Zhu, Zhiyu, et autres
Publié: (2025)
Multi-Group Proportional Representation for Text-to-Image Models
par: Jung, Sangwon, et autres
Publié: (2025)
par: Jung, Sangwon, et autres
Publié: (2025)
Representations of Text and Images Align From Layer One
par: Wybitul, Evžen, et autres
Publié: (2026)
par: Wybitul, Evžen, et autres
Publié: (2026)
Improving Explicit Spatial Relationships in Text-to-Image Generation through an Automatically Derived Dataset
par: Salaberria, Ander, et autres
Publié: (2024)
par: Salaberria, Ander, et autres
Publié: (2024)
GeoDiffusion: Text-Prompted Geometric Control for Object Detection Data Generation
par: Chen, Kai, et autres
Publié: (2023)
par: Chen, Kai, et autres
Publié: (2023)
Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education
par: Wang, Junling, et autres
Publié: (2026)
par: Wang, Junling, et autres
Publié: (2026)
Is One GPU Enough? Pushing Image Generation at Higher-Resolutions with Foundation Models
par: Tragakis, Athanasios, et autres
Publié: (2024)
par: Tragakis, Athanasios, et autres
Publié: (2024)
Improving the Detection of Small Oriented Objects in Aerial Images
par: Doloriel, Chandler Timm C., et autres
Publié: (2024)
par: Doloriel, Chandler Timm C., et autres
Publié: (2024)
Compositional Text-to-Image Generation with Dense Blob Representations
par: Nie, Weili, et autres
Publié: (2024)
par: Nie, Weili, et autres
Publié: (2024)
Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image
par: Zhao, Yu, et autres
Publié: (2024)
par: Zhao, Yu, et autres
Publié: (2024)
Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback
par: Furuta, Hiroki, et autres
Publié: (2024)
par: Furuta, Hiroki, et autres
Publié: (2024)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
par: Dai, Josef, et autres
Publié: (2024)
par: Dai, Josef, et autres
Publié: (2024)
Interpreting CLIP's Image Representation via Text-Based Decomposition
par: Gandelsman, Yossi, et autres
Publié: (2023)
par: Gandelsman, Yossi, et autres
Publié: (2023)
BiGR: Harnessing Binary Latent Codes for Image Generation and Improved Visual Representation Capabilities
par: Hao, Shaozhe, et autres
Publié: (2024)
par: Hao, Shaozhe, et autres
Publié: (2024)
Agentic Retoucher for Text-To-Image Generation
par: Shen, Shaocheng, et autres
Publié: (2026)
par: Shen, Shaocheng, et autres
Publié: (2026)
InteractMove: Text-Controlled Human-Object Interaction Generation in 3D Scenes with Movable Objects
par: Cai, Xinhao, et autres
Publié: (2025)
par: Cai, Xinhao, et autres
Publié: (2025)
Reflective Human-Machine Co-adaptation for Enhanced Text-to-Image Generation Dialogue System
par: Feng, Yuheng, et autres
Publié: (2024)
par: Feng, Yuheng, et autres
Publié: (2024)
Evaluating Text-to-Image Generative Models: An Empirical Study on Human Image Synthesis
par: Chen, Muxi, et autres
Publié: (2024)
par: Chen, Muxi, et autres
Publié: (2024)
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
par: Duan, Zhongjie, et autres
Publié: (2024)
par: Duan, Zhongjie, et autres
Publié: (2024)
HanDiffuser: Text-to-Image Generation With Realistic Hand Appearances
par: Narasimhaswamy, Supreeth, et autres
Publié: (2024)
par: Narasimhaswamy, Supreeth, et autres
Publié: (2024)
Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering
par: Lim, Youngsun, et autres
Publié: (2024)
par: Lim, Youngsun, et autres
Publié: (2024)
Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos
par: Thomas, Xavier, et autres
Publié: (2025)
par: Thomas, Xavier, et autres
Publié: (2025)
Personalized Reward Modeling for Text-to-Image Generation
par: Lee, Jeongeun, et autres
Publié: (2025)
par: Lee, Jeongeun, et autres
Publié: (2025)
Dynamic Prompt Optimizing for Text-to-Image Generation
par: Mo, Wenyi, et autres
Publié: (2024)
par: Mo, Wenyi, et autres
Publié: (2024)
Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance
par: Qiu, Jason, et autres
Publié: (2026)
par: Qiu, Jason, et autres
Publié: (2026)
Documents similaires
-
Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs
par: Chen, Tianle, et autres
Publié: (2025) -
Progressive Prompt Detailing for Improved Alignment in Text-to-Image Generative Models
par: Saichandran, Ketan Suhaas, et autres
Publié: (2025) -
FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models
par: Lim, Youngsun, et autres
Publié: (2026) -
A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning
par: Chen, Tianle, et autres
Publié: (2026) -
DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers
par: Kim, Dahye, et autres
Publié: (2026)