Images Speak Louder Than Scores: Failure Mode Escape for Enhancing Generative Quality
Fuente:
arXiv
Guardado en:
| Autores principales: | Shao, Jie, Zhu, Ke, Fu, Minghao, Wang, Guo-hua, Wu, Jianxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Disentangled Concepts Speak Louder Than Words: Explainable Video Action Recognition
por: Lee, Jongseo, et al.
Publicado: (2025)
por: Lee, Jongseo, et al.
Publicado: (2025)
Rectify the Regression Bias in Long-Tailed Object Detection
por: Zhu, Ke, et al.
Publicado: (2024)
por: Zhu, Ke, et al.
Publicado: (2024)
Quantization without Tears
por: Fu, Minghao, et al.
Publicado: (2024)
por: Fu, Minghao, et al.
Publicado: (2024)
DTL: Disentangled Transfer Learning for Visual Recognition
por: Fu, Minghao, et al.
Publicado: (2023)
por: Fu, Minghao, et al.
Publicado: (2023)
Low-rank Attention Side-Tuning for Parameter-Efficient Fine-Tuning
por: Tang, Ningyuan, et al.
Publicado: (2024)
por: Tang, Ningyuan, et al.
Publicado: (2024)
When Images Speak Louder: Mitigating Language Bias-induced Hallucinations in VLMs through Cross-Modal Guidance
por: Cao, Jinjin, et al.
Publicado: (2025)
por: Cao, Jinjin, et al.
Publicado: (2025)
DiffuLT: How to Make Diffusion Model Useful for Long-tail Recognition
por: Shao, Jie, et al.
Publicado: (2024)
por: Shao, Jie, et al.
Publicado: (2024)
Minimal Interaction Separated Tuning: A New Paradigm for Visual Adaptation
por: Tang, Ningyuan, et al.
Publicado: (2024)
por: Tang, Ningyuan, et al.
Publicado: (2024)
Skeletons Speak Louder than Text: A Motion-Aware Pretraining Paradigm for Video-Based Person Re-Identification
por: Lin, Rifen, et al.
Publicado: (2025)
por: Lin, Rifen, et al.
Publicado: (2025)
Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models
por: Wang, Zhaochen, et al.
Publicado: (2025)
por: Wang, Zhaochen, et al.
Publicado: (2025)
QwT-v2: Practical, Effective and Efficient Post-Training Quantization
por: Tang, Ningyuan, et al.
Publicado: (2025)
por: Tang, Ningyuan, et al.
Publicado: (2025)
Diffusion Product Quantization
por: Shao, Jie, et al.
Publicado: (2024)
por: Shao, Jie, et al.
Publicado: (2024)
Continuous Visual Autoregressive Generation via Score Maximization
por: Shao, Chenze, et al.
Publicado: (2025)
por: Shao, Chenze, et al.
Publicado: (2025)
Teaching LMMs for Image Quality Scoring and Interpreting
por: Zhang, Zicheng, et al.
Publicado: (2025)
por: Zhang, Zicheng, et al.
Publicado: (2025)
FaceScore: Benchmarking and Enhancing Face Quality in Human Generation
por: Liao, Zhenyi, et al.
Publicado: (2024)
por: Liao, Zhenyi, et al.
Publicado: (2024)
Stable Score Distillation for High-Quality 3D Generation
por: Tang, Boshi, et al.
Publicado: (2023)
por: Tang, Boshi, et al.
Publicado: (2023)
ModeDreamer: Mode Guiding Score Distillation for Text-to-3D Generation using Reference Image Prompts
por: Tran, Uy Dieu, et al.
Publicado: (2024)
por: Tran, Uy Dieu, et al.
Publicado: (2024)
Forge-and-Quench: Enhancing Image Generation for Higher Fidelity in Unified Multimodal Models
por: Zeng, Yanbing, et al.
Publicado: (2026)
por: Zeng, Yanbing, et al.
Publicado: (2026)
All You Need in Knowledge Distillation Is a Tailored Coordinate System
por: Zhou, Junjie, et al.
Publicado: (2024)
por: Zhou, Junjie, et al.
Publicado: (2024)
CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation
por: Fu, Minghao, et al.
Publicado: (2025)
por: Fu, Minghao, et al.
Publicado: (2025)
Images Speak Louder than Words: Understanding and Mitigating Bias in Vision-Language Model from a Causal Mediation Perspective
por: Weng, Zhaotian, et al.
Publicado: (2024)
por: Weng, Zhaotian, et al.
Publicado: (2024)
Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation
por: He, Yiguo, et al.
Publicado: (2025)
por: He, Yiguo, et al.
Publicado: (2025)
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
por: Fu, Kang, et al.
Publicado: (2026)
por: Fu, Kang, et al.
Publicado: (2026)
Global-Local Image Perceptual Score (GLIPS): Evaluating Photorealistic Quality of AI-Generated Images
por: Aziz, Memoona, et al.
Publicado: (2024)
por: Aziz, Memoona, et al.
Publicado: (2024)
A Quality-Guided Mixture of Score-Fusion Experts Framework for Human Recognition
por: Zhu, Jie, et al.
Publicado: (2025)
por: Zhu, Jie, et al.
Publicado: (2025)
More Images, More Problems? A Controlled Analysis of VLM Failure Modes
por: Das, Anurag, et al.
Publicado: (2026)
por: Das, Anurag, et al.
Publicado: (2026)
Understanding the Failure Modes of Out-of-Distribution Generalization
por: Nagarajan, Vaishnavh, et al.
Publicado: (2020)
por: Nagarajan, Vaishnavh, et al.
Publicado: (2020)
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
por: Wang, Yueqian, et al.
Publicado: (2024)
por: Wang, Yueqian, et al.
Publicado: (2024)
Let ViT Speak: Generative Language-Image Pre-training
por: Fang, Yan, et al.
Publicado: (2026)
por: Fang, Yan, et al.
Publicado: (2026)
Segment Any-Quality Images with Generative Latent Space Enhancement
por: Guo, Guangqian, et al.
Publicado: (2025)
por: Guo, Guangqian, et al.
Publicado: (2025)
TetSphere Splatting: Representing High-Quality Geometry with Lagrangian Volumetric Meshes
por: Guo, Minghao, et al.
Publicado: (2024)
por: Guo, Minghao, et al.
Publicado: (2024)
Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring
por: Xie, Qizhi, et al.
Publicado: (2025)
por: Xie, Qizhi, et al.
Publicado: (2025)
Analytic Score Optimization for Multi Dimension Video Quality Assessment
por: Lin, Boda, et al.
Publicado: (2026)
por: Lin, Boda, et al.
Publicado: (2026)
Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution
por: You, Zhiyuan, et al.
Publicado: (2025)
por: You, Zhiyuan, et al.
Publicado: (2025)
Radiology Report Generation for Low-Quality X-Ray Images
por: Zhu, Hongze, et al.
Publicado: (2026)
por: Zhu, Hongze, et al.
Publicado: (2026)
Deep Feature Statistics Mapping for Generalized Screen Content Image Quality Assessment
por: Chen, Baoliang, et al.
Publicado: (2022)
por: Chen, Baoliang, et al.
Publicado: (2022)
PRIME: Prioritizing Interpretability in Failure Mode Extraction
por: Rezaei, Keivan, et al.
Publicado: (2023)
por: Rezaei, Keivan, et al.
Publicado: (2023)
Semantic Data Augmentation Enhanced Invariant Risk Minimization for Medical Image Domain Generalization
por: Zhu, Yaoyao, et al.
Publicado: (2025)
por: Zhu, Yaoyao, et al.
Publicado: (2025)
Taming Mode Collapse in Score Distillation for Text-to-3D Generation
por: Wang, Peihao, et al.
Publicado: (2023)
por: Wang, Peihao, et al.
Publicado: (2023)
CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation
por: Zhang, Hui, et al.
Publicado: (2024)
por: Zhang, Hui, et al.
Publicado: (2024)
Ejemplares similares
-
Disentangled Concepts Speak Louder Than Words: Explainable Video Action Recognition
por: Lee, Jongseo, et al.
Publicado: (2025) -
Rectify the Regression Bias in Long-Tailed Object Detection
por: Zhu, Ke, et al.
Publicado: (2024) -
Quantization without Tears
por: Fu, Minghao, et al.
Publicado: (2024) -
DTL: Disentangled Transfer Learning for Visual Recognition
por: Fu, Minghao, et al.
Publicado: (2023) -
Low-rank Attention Side-Tuning for Parameter-Efficient Fine-Tuning
por: Tang, Ningyuan, et al.
Publicado: (2024)