Interpreting Low-level Vision Models with Causal Effect Maps
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Jinfan, Gu, Jinjin, Yu, Shiyao, Yu, Fanghua, Li, Zheyuan, You, Zhiyuan, Lu, Chaochao, Dong, Chao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniCon: Unidirectional Information Flow for Effective Control of Large-Scale Diffusion Models
par: Yu, Fanghua, et autres
Publié: (2025)
par: Yu, Fanghua, et autres
Publié: (2025)
Revisiting the Generalization Problem of Low-level Vision Models Through the Lens of Image Deraining
par: Hu, Jinfan, et autres
Publié: (2025)
par: Hu, Jinfan, et autres
Publié: (2025)
Position: Evaluation of Visual Processing Should Be Human-Centered, Not Metric-Centered
par: Hu, Jinfan, et autres
Publié: (2026)
par: Hu, Jinfan, et autres
Publié: (2026)
Harnessing Diffusion-Yielded Score Priors for Image Restoration
par: Lin, Xinqi, et autres
Publié: (2025)
par: Lin, Xinqi, et autres
Publié: (2025)
Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration In the Wild
par: Yu, Fanghua, et autres
Publié: (2024)
par: Yu, Fanghua, et autres
Publié: (2024)
How far have we gone in Generative Image Restoration? A study on its capability, limitations and evaluation practices
par: Yin, Xiang, et autres
Publié: (2026)
par: Yin, Xiang, et autres
Publié: (2026)
Depicting Beyond Scores: Advancing Image Quality Assessment through Multi-modal Language Models
par: You, Zhiyuan, et autres
Publié: (2023)
par: You, Zhiyuan, et autres
Publié: (2023)
LM4LV: A Frozen Large Language Model for Low-level Vision Tasks
par: Zheng, Boyang, et autres
Publié: (2024)
par: Zheng, Boyang, et autres
Publié: (2024)
An Intelligent Agentic System for Complex Image Restoration Problems
par: Zhu, Kaiwen, et autres
Publié: (2024)
par: Zhu, Kaiwen, et autres
Publié: (2024)
Enhancing Descriptive Image Quality Assessment with A Large-scale Multi-modal Dataset
par: You, Zhiyuan, et autres
Publié: (2024)
par: You, Zhiyuan, et autres
Publié: (2024)
Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution
par: You, Zhiyuan, et autres
Publié: (2025)
par: You, Zhiyuan, et autres
Publié: (2025)
CELLO: Causal Evaluation of Large Vision-Language Models
par: Chen, Meiqi, et autres
Publié: (2024)
par: Chen, Meiqi, et autres
Publié: (2024)
ADAM: An Embodied Causal Agent in Open-World Environments
par: Yu, Shu, et autres
Publié: (2024)
par: Yu, Shu, et autres
Publié: (2024)
PhotoFramer: Multi-modal Image Composition Instruction
par: You, Zhiyuan, et autres
Publié: (2025)
par: You, Zhiyuan, et autres
Publié: (2025)
Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters
par: Yu, Jiazuo, et autres
Publié: (2024)
par: Yu, Jiazuo, et autres
Publié: (2024)
LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models
par: Yu, Shu, et autres
Publié: (2025)
par: Yu, Shu, et autres
Publié: (2025)
Position: Agentic Systems Constitute a Key Component of Next-Generation Intelligent Image Processing
par: Gu, Jinjin
Publié: (2025)
par: Gu, Jinjin
Publié: (2025)
A Preliminary Exploration Towards General Image Restoration
par: Kong, Xiangtao, et autres
Publié: (2024)
par: Kong, Xiangtao, et autres
Publié: (2024)
Semantics-Aware Human Motion Generation from Audio Instructions
par: Wang, Zi-An, et autres
Publié: (2025)
par: Wang, Zi-An, et autres
Publié: (2025)
Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
par: Chen, Meiqi, et autres
Publié: (2024)
par: Chen, Meiqi, et autres
Publié: (2024)
Interpretable and Testable Vision Features via Sparse Autoencoders
par: Stevens, Samuel, et autres
Publié: (2025)
par: Stevens, Samuel, et autres
Publié: (2025)
Exploring Scalable Unified Modeling for General Low-Level Vision
par: Chen, Xiangyu, et autres
Publié: (2025)
par: Chen, Xiangyu, et autres
Publié: (2025)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
par: Weng, Fenghua, et autres
Publié: (2025)
par: Weng, Fenghua, et autres
Publié: (2025)
Learning A Low-Level Vision Generalist via Visual Task Prompt
par: Chen, Xiangyu, et autres
Publié: (2024)
par: Chen, Xiangyu, et autres
Publié: (2024)
DiffBIR: Towards Blind Image Restoration with Generative Diffusion Prior
par: Lin, Xinqi, et autres
Publié: (2023)
par: Lin, Xinqi, et autres
Publié: (2023)
Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties
par: Yu, Keunwoo Peter, et autres
Publié: (2023)
par: Yu, Keunwoo Peter, et autres
Publié: (2023)
CauSight: Learning to Supersense for Visual Causal Discovery
par: Zhang, Yize, et autres
Publié: (2025)
par: Zhang, Yize, et autres
Publié: (2025)
TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios
par: Yu, Qiucheng, et autres
Publié: (2026)
par: Yu, Qiucheng, et autres
Publié: (2026)
Paparazzo: Active Mapping of Moving 3D Objects
par: Allegro, Davide, et autres
Publié: (2026)
par: Allegro, Davide, et autres
Publié: (2026)
Causal Tracing of Object Representations in Large Vision Language Models: Mechanistic Interpretability and Hallucination Mitigation
par: Li, Qiming, et autres
Publié: (2025)
par: Li, Qiming, et autres
Publié: (2025)
Causal Interpretation of Sparse Autoencoder Features in Vision
par: Han, Sangyu, et autres
Publié: (2025)
par: Han, Sangyu, et autres
Publié: (2025)
Towards Training-free Anomaly Detection with Vision and Language Foundation Models
par: Zhang, Jinjin, et autres
Publié: (2025)
par: Zhang, Jinjin, et autres
Publié: (2025)
A Comparative Study of Image Restoration Networks for General Backbone Network Design
par: Chen, Xiangyu, et autres
Publié: (2023)
par: Chen, Xiangyu, et autres
Publié: (2023)
MapSR: Prompt-Driven Land Cover Map Super-Resolution via Vision Foundation Models
par: Wang, Ruiqi, et autres
Publié: (2026)
par: Wang, Ruiqi, et autres
Publié: (2026)
Causality-guided Prompt Learning for Vision-language Models via Visual Granulation
par: Gao, Mengyu, et autres
Publié: (2025)
par: Gao, Mengyu, et autres
Publié: (2025)
Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering
par: Liu, Shuliang, et autres
Publié: (2026)
par: Liu, Shuliang, et autres
Publié: (2026)
ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation
par: Peng, Bo, et autres
Publié: (2023)
par: Peng, Bo, et autres
Publié: (2023)
SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution
par: Xie, Liangbin, et autres
Publié: (2025)
par: Xie, Liangbin, et autres
Publié: (2025)
Towards Causal Physical Error Discovery in Video Analytics Systems
par: Zhao, Jinjin, et autres
Publié: (2024)
par: Zhao, Jinjin, et autres
Publié: (2024)
AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models
par: Mahmood, Hazza, et autres
Publié: (2026)
par: Mahmood, Hazza, et autres
Publié: (2026)
Documents similaires
-
UniCon: Unidirectional Information Flow for Effective Control of Large-Scale Diffusion Models
par: Yu, Fanghua, et autres
Publié: (2025) -
Revisiting the Generalization Problem of Low-level Vision Models Through the Lens of Image Deraining
par: Hu, Jinfan, et autres
Publié: (2025) -
Position: Evaluation of Visual Processing Should Be Human-Centered, Not Metric-Centered
par: Hu, Jinfan, et autres
Publié: (2026) -
Harnessing Diffusion-Yielded Score Priors for Image Restoration
par: Lin, Xinqi, et autres
Publié: (2025) -
Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration In the Wild
par: Yu, Fanghua, et autres
Publié: (2024)