Enregistré dans:
| Auteurs principaux: | Palmini, Maria-Teresa De Rosa, Cetinic, Eva |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2511.11435 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Synthetic History: Evaluating Visual Representations of the Past in Diffusion Models
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2025)
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2025)
Civiverse: A Dataset for Analyzing User Engagement with Open-Source Text-to-Image Models
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2024)
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2024)
Exploring Language Patterns of Prompts in Text-to-Image Generation and Their Impact on Visual Diversity
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2025)
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2025)
Patterns of Creativity: How User Input Shapes AI-Generated Visual Diversity
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2024)
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2024)
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
par: Huang, Siyuan, et autres
Publié: (2026)
par: Huang, Siyuan, et autres
Publié: (2026)
Memory-Efficient Fine-Tuning for Quantized Diffusion Model
par: Ryu, Hyogon, et autres
Publié: (2024)
par: Ryu, Hyogon, et autres
Publié: (2024)
Diffusion Models Through a Global Lens: Are They Culturally Inclusive?
par: Bayramli, Zahra, et autres
Publié: (2025)
par: Bayramli, Zahra, et autres
Publié: (2025)
Learning Plug-and-play Memory for Guiding Video Diffusion Models
par: Song, Selena, et autres
Publié: (2025)
par: Song, Selena, et autres
Publié: (2025)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
par: Wang, Yizhou, et autres
Publié: (2025)
par: Wang, Yizhou, et autres
Publié: (2025)
Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines
par: Kim, Junwan, et autres
Publié: (2026)
par: Kim, Junwan, et autres
Publié: (2026)
Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
par: Kim, Keuntae, et autres
Publié: (2026)
par: Kim, Keuntae, et autres
Publié: (2026)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
par: Mao, Jiawei, et autres
Publié: (2025)
par: Mao, Jiawei, et autres
Publié: (2025)
Universal Fingerprint Generation: Controllable Diffusion Model with Multimodal Conditions
par: Grosz, Steven A., et autres
Publié: (2024)
par: Grosz, Steven A., et autres
Publié: (2024)
TRACER: Persistent Regularization for Robust Multimodal Finetuning
par: Asadollahzadeh, Hesam, et autres
Publié: (2026)
par: Asadollahzadeh, Hesam, et autres
Publié: (2026)
Culture In a Frame: C$^3$B as a Comic-Based Benchmark for Multimodal Culturally Awareness
par: Song, Yuchen, et autres
Publié: (2025)
par: Song, Yuchen, et autres
Publié: (2025)
The Power of Many: Multi-Agent Multimodal Models for Cultural Image Captioning
par: Bai, Longju, et autres
Publié: (2024)
par: Bai, Longju, et autres
Publié: (2024)
DPDEdit: Detail-Preserved Diffusion Models for Multimodal Fashion Image Editing
par: Wang, Xiaolong, et autres
Publié: (2024)
par: Wang, Xiaolong, et autres
Publié: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026)
par: Chen, Tao, et autres
Publié: (2026)
Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation
par: Xu, Yunzhe, et autres
Publié: (2025)
par: Xu, Yunzhe, et autres
Publié: (2025)
The Influence of Iconicity in Transfer Learning for Sign Language Recognition
par: Artiaga, Keren, et autres
Publié: (2026)
par: Artiaga, Keren, et autres
Publié: (2026)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
par: Zhong, Weihong, et autres
Publié: (2024)
par: Zhong, Weihong, et autres
Publié: (2024)
KOALA: Empirical Lessons Toward Memory-Efficient and Fast Diffusion Models for Text-to-Image Synthesis
par: Lee, Youngwan, et autres
Publié: (2023)
par: Lee, Youngwan, et autres
Publié: (2023)
Diffusion-Guided Semantic Consistency for Multimodal Heterogeneity
par: Liu, Jing, et autres
Publié: (2026)
par: Liu, Jing, et autres
Publié: (2026)
Fast and Memory-Efficient Video Diffusion Using Streamlined Inference
par: Zhan, Zheng, et autres
Publié: (2024)
par: Zhan, Zheng, et autres
Publié: (2024)
Diffuse Everything: Multimodal Diffusion Models on Arbitrary State Spaces
par: Rojas, Kevin, et autres
Publié: (2025)
par: Rojas, Kevin, et autres
Publié: (2025)
The BLA Benchmark: Investigating Basic Language Abilities of Pre-Trained Multimodal Models
par: Chen, Xinyi, et autres
Publié: (2023)
par: Chen, Xinyi, et autres
Publié: (2023)
TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model
par: Yang, Cheng, et autres
Publié: (2025)
par: Yang, Cheng, et autres
Publié: (2025)
Plots Unlock Time-Series Understanding in Multimodal Models
par: Daswani, Mayank, et autres
Publié: (2024)
par: Daswani, Mayank, et autres
Publié: (2024)
GarmentDiffusion: 3D Garment Sewing Pattern Generation with Multimodal Diffusion Transformers
par: Li, Xinyu, et autres
Publié: (2025)
par: Li, Xinyu, et autres
Publié: (2025)
Reference-Guided Diffusion Inpainting For Multimodal Counterfactual Generation
par: Buburuzan, Alexandru
Publié: (2025)
par: Buburuzan, Alexandru
Publié: (2025)
Cultural Heritage 3D Reconstruction with Diffusion Networks
par: Jaramillo, Pablo, et autres
Publié: (2024)
par: Jaramillo, Pablo, et autres
Publié: (2024)
The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents
par: Sun, Yuwei, et autres
Publié: (2026)
par: Sun, Yuwei, et autres
Publié: (2026)
MixDQ: Memory-Efficient Few-Step Text-to-Image Diffusion Models with Metric-Decoupled Mixed Precision Quantization
par: Zhao, Tianchen, et autres
Publié: (2024)
par: Zhao, Tianchen, et autres
Publié: (2024)
MemoryMamba: Memory-Augmented State Space Model for Defect Recognition
par: Wang, Qianning, et autres
Publié: (2024)
par: Wang, Qianning, et autres
Publié: (2024)
MSDM: Generating Task-Specific Pathology Images with a Multimodal Conditioned Diffusion Model for Cell and Nuclei Segmentation
par: Winter, Dominik, et autres
Publié: (2025)
par: Winter, Dominik, et autres
Publié: (2025)
From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis
par: Zhou, Fangshuo, et autres
Publié: (2024)
par: Zhou, Fangshuo, et autres
Publié: (2024)
Creating a Lens of Chinese Culture: A Multimodal Dataset for Chinese Pun Rebus Art Understanding
par: Zhang, Tuo, et autres
Publié: (2024)
par: Zhang, Tuo, et autres
Publié: (2024)
CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains
par: Wang, Wenhan, et autres
Publié: (2026)
par: Wang, Wenhan, et autres
Publié: (2026)
TeleMem: Building Long-Term and Multimodal Memory for Agentic AI
par: Chen, Chunliang, et autres
Publié: (2025)
par: Chen, Chunliang, et autres
Publié: (2025)
Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
par: Lin, Han, et autres
Publié: (2025)
par: Lin, Han, et autres
Publié: (2025)
Documents similaires
-
Synthetic History: Evaluating Visual Representations of the Past in Diffusion Models
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2025) -
Civiverse: A Dataset for Analyzing User Engagement with Open-Source Text-to-Image Models
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2024) -
Exploring Language Patterns of Prompts in Text-to-Image Generation and Their Impact on Visual Diversity
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2025) -
Patterns of Creativity: How User Input Shapes AI-Generated Visual Diversity
par: Palmini, Maria-Teresa De Rosa, et autres
Publié: (2024) -
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
par: Huang, Siyuan, et autres
Publié: (2026)