Object-Attribute Binding in Text-to-Image Generation: Evaluation and Control
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Trusca, Maria Mihaela, Nuyts, Wolf, Thomm, Jonathan, Honig, Robert, Hofmann, Thomas, Tuytelaars, Tinne, Moens, Marie-Francine |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DM-Align: Leveraging the Power of Natural Language Instructions to Make Changes to Images
par: Trusca, Maria Mihaela, et autres
Publié: (2024)
par: Trusca, Maria Mihaela, et autres
Publié: (2024)
Visually-Aware Context Modeling for News Image Captioning
par: Qu, Tingyu, et autres
Publié: (2023)
par: Qu, Tingyu, et autres
Publié: (2023)
Towards More Accurate Personalized Image Generation: Addressing Overfitting and Evaluation Bias
par: Li, Mingxiao, et autres
Publié: (2025)
par: Li, Mingxiao, et autres
Publié: (2025)
Introducing Routing Functions to Vision-Language Parameter-Efficient Fine-Tuning with Low-Rank Bottlenecks
par: Qu, Tingyu, et autres
Publié: (2024)
par: Qu, Tingyu, et autres
Publié: (2024)
Action-based image editing guided by human instructions
par: Trusca, Maria Mihaela, et autres
Publié: (2024)
par: Trusca, Maria Mihaela, et autres
Publié: (2024)
Animate Your Motion: Turning Still Images into Dynamic Videos
par: Li, Mingxiao, et autres
Publié: (2024)
par: Li, Mingxiao, et autres
Publié: (2024)
TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models
par: Qu, Tingyu, et autres
Publié: (2024)
par: Qu, Tingyu, et autres
Publié: (2024)
Remembering by Reconstructing: Domain Incremental Learning With Test-Time Training on Video Streams
par: Swinnen, Jonathan, et autres
Publié: (2026)
par: Swinnen, Jonathan, et autres
Publié: (2026)
PEO: Training-Free Aesthetic Quality Enhancement in Pre-Trained Text-to-Image Diffusion Models with Prompt Embedding Optimization
par: Margaryan, Hovhannes, et autres
Publié: (2025)
par: Margaryan, Hovhannes, et autres
Publié: (2025)
Object-Centric Pretraining via Target Encoder Bootstrapping
par: Đukić, Nikola, et autres
Publié: (2025)
par: Đukić, Nikola, et autres
Publié: (2025)
Learning to Route for Dynamic Adapter Composition in Continual Learning with Language Models
par: Araujo, Vladimir, et autres
Publié: (2024)
par: Araujo, Vladimir, et autres
Publié: (2024)
Spec-Gloss Surfels and Normal-Diffuse Priors for Relightable Glossy Objects
par: Kouros, Georgios, et autres
Publié: (2025)
par: Kouros, Georgios, et autres
Publié: (2025)
Implicit Gaussian Splatting with Efficient Multi-Level Tri-Plane Representation
par: Wu, Minye, et autres
Publié: (2024)
par: Wu, Minye, et autres
Publié: (2024)
Analysis of Spatial augmentation in Self-supervised models in the purview of training and test distributions
par: Jha, Abhishek, et autres
Publié: (2024)
par: Jha, Abhishek, et autres
Publié: (2024)
Charm: The Missing Piece in ViT fine-tuning for Image Aesthetic Assessment
par: Behrad, Fatemeh, et autres
Publié: (2025)
par: Behrad, Fatemeh, et autres
Publié: (2025)
NewsRECON: News article REtrieval for image CONtextualization
par: Tonglet, Jonathan, et autres
Publié: (2026)
par: Tonglet, Jonathan, et autres
Publié: (2026)
Protecting multimodal large language models against misleading visualizations
par: Tonglet, Jonathan, et autres
Publié: (2025)
par: Tonglet, Jonathan, et autres
Publié: (2025)
CrIBo: Self-Supervised Learning via Cross-Image Object-Level Bootstrapping
par: Lebailly, Tim, et autres
Publié: (2023)
par: Lebailly, Tim, et autres
Publié: (2023)
Automated Prompt Generation for Creative and Counterfactual Text-to-image Synthesis
par: Jelaca, Aleksa, et autres
Publié: (2025)
par: Jelaca, Aleksa, et autres
Publié: (2025)
Consistent Story Generation: Unlocking the Potential of Zigzag Sampling
par: Li, Mingxiao, et autres
Publié: (2025)
par: Li, Mingxiao, et autres
Publié: (2025)
Explicitly Representing Syntax Improves Sentence-to-layout Prediction of Unexpected Situations
par: Nuyts, Wolf, et autres
Publié: (2024)
par: Nuyts, Wolf, et autres
Publié: (2024)
RGS-DR: Deferred Reflections and Residual Shading in 2D Gaussian Splatting
par: Kouros, Georgios, et autres
Publié: (2025)
par: Kouros, Georgios, et autres
Publié: (2025)
Sequence-to-Sequence Spanish Pre-trained Language Models
par: Araujo, Vladimir, et autres
Publié: (2023)
par: Araujo, Vladimir, et autres
Publié: (2023)
Is this chart lying to me? Automating the detection of misleading visualizations
par: Tonglet, Jonathan, et autres
Publié: (2025)
par: Tonglet, Jonathan, et autres
Publié: (2025)
Same accuracy, twice as fast: continuous training surpasses retraining from scratch
par: Verwimp, Eli, et autres
Publié: (2025)
par: Verwimp, Eli, et autres
Publié: (2025)
Eff-GRot: Efficient and Generalizable Rotation Estimation with Transformers
par: Mathioulakis, Fanis, et autres
Publié: (2025)
par: Mathioulakis, Fanis, et autres
Publié: (2025)
When normalization hallucinates: unseen risks in AI-powered whole slide image processing
par: Moens, Karel, et autres
Publié: (2025)
par: Moens, Karel, et autres
Publié: (2025)
Contrastive Learning for Multi-Object Tracking with Transformers
par: De Plaen, Pierre-François, et autres
Publié: (2023)
par: De Plaen, Pierre-François, et autres
Publié: (2023)
Unsupervised Parameter Efficient Source-free Post-pretraining
par: Jha, Abhishek, et autres
Publié: (2025)
par: Jha, Abhishek, et autres
Publié: (2025)
DAVE: Diagnostic benchmark for Audio Visual Evaluation
par: Radevski, Gorjan, et autres
Publié: (2025)
par: Radevski, Gorjan, et autres
Publié: (2025)
On the Role of Individual Differences in Current Approaches to Computational Image Aesthetics
par: Chen, Li-Wei, et autres
Publié: (2025)
par: Chen, Li-Wei, et autres
Publié: (2025)
Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings
par: Zarei, Arman, et autres
Publié: (2024)
par: Zarei, Arman, et autres
Publié: (2024)
Forgetting of task-specific knowledge in model merging-based continual learning
par: Hess, Timm, et autres
Publié: (2025)
par: Hess, Timm, et autres
Publié: (2025)
NeuroCine: Decoding Vivid Video Sequences from Human Brain Activties
par: Sun, Jingyuan, et autres
Publié: (2024)
par: Sun, Jingyuan, et autres
Publié: (2024)
Common Data Properties Limit Object-Attribute Binding in CLIP
par: Gurung, Bijay, et autres
Publié: (2025)
par: Gurung, Bijay, et autres
Publié: (2025)
Unveiling the Ambiguity in Neural Inverse Rendering: A Parameter Compensation Analysis
par: Kouros, Georgios, et autres
Publié: (2024)
par: Kouros, Georgios, et autres
Publié: (2024)
OASIS: Online Sample Selection for Continual Visual Instruction Tuning
par: Lee, Minjae, et autres
Publié: (2025)
par: Lee, Minjae, et autres
Publié: (2025)
Classifying Novel 3D-Printed Objects without Retraining: Towards Post-Production Automation in Additive Manufacturing
par: Mathioulakis, Fanis, et autres
Publié: (2026)
par: Mathioulakis, Fanis, et autres
Publié: (2026)
Evaluating Attribute Confusion in Fashion Text-to-Image Generation
par: Liu, Ziyue, et autres
Publié: (2025)
par: Liu, Ziyue, et autres
Publié: (2025)
Continual Learning of Diffusion Models with Generative Distillation
par: Masip, Sergi, et autres
Publié: (2023)
par: Masip, Sergi, et autres
Publié: (2023)
Documents similaires
-
DM-Align: Leveraging the Power of Natural Language Instructions to Make Changes to Images
par: Trusca, Maria Mihaela, et autres
Publié: (2024) -
Visually-Aware Context Modeling for News Image Captioning
par: Qu, Tingyu, et autres
Publié: (2023) -
Towards More Accurate Personalized Image Generation: Addressing Overfitting and Evaluation Bias
par: Li, Mingxiao, et autres
Publié: (2025) -
Introducing Routing Functions to Vision-Language Parameter-Efficient Fine-Tuning with Low-Rank Bottlenecks
par: Qu, Tingyu, et autres
Publié: (2024) -
Action-based image editing guided by human instructions
par: Trusca, Maria Mihaela, et autres
Publié: (2024)