Image Fusion via Vision-Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Zixiang, Deng, Lilun, Bai, Haowen, Cui, Yukun, Zhang, Zhipeng, Zhang, Yulun, Qin, Haotong, Chen, Dongdong, Zhang, Jiangshe, Wang, Peng, Van Gool, Luc |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Retinex-MEF: Retinex-based Glare Effects Aware Unsupervised Multi-Exposure Image Fusion
di: Bai, Haowen, et al.
Pubblicazione: (2025)
di: Bai, Haowen, et al.
Pubblicazione: (2025)
Deep Unfolding Multi-modal Image Fusion Network via Attribution Analysis
di: Bai, Haowen, et al.
Pubblicazione: (2025)
di: Bai, Haowen, et al.
Pubblicazione: (2025)
ReFusion: Learning Image Fusion from Reconstruction with Learnable Loss via Meta-Learning
di: Bai, Haowen, et al.
Pubblicazione: (2023)
di: Bai, Haowen, et al.
Pubblicazione: (2023)
Task-driven Image Fusion with Learnable Fusion Loss
di: Bai, Haowen, et al.
Pubblicazione: (2024)
di: Bai, Haowen, et al.
Pubblicazione: (2024)
Equivariant Multi-Modality Image Fusion
di: Zhao, Zixiang, et al.
Pubblicazione: (2023)
di: Zhao, Zixiang, et al.
Pubblicazione: (2023)
MambaVF: State Space Model for Efficient Video Fusion
di: Zhao, Zixiang, et al.
Pubblicazione: (2026)
di: Zhao, Zixiang, et al.
Pubblicazione: (2026)
A Unified Solution to Video Fusion: From Multi-Frame Learning to Benchmarking
di: Zhao, Zixiang, et al.
Pubblicazione: (2025)
di: Zhao, Zixiang, et al.
Pubblicazione: (2025)
Simultaneous Automatic Picking and Manual Picking Refinement for First-Break
di: Bai, Haowen, et al.
Pubblicazione: (2025)
di: Bai, Haowen, et al.
Pubblicazione: (2025)
Hipandas: Hyperspectral Image Joint Denoising and Super-Resolution by Image Fusion with the Panchromatic Image
di: Xu, Shuang, et al.
Pubblicazione: (2024)
di: Xu, Shuang, et al.
Pubblicazione: (2024)
FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing
di: Wu, Junyi, et al.
Pubblicazione: (2025)
di: Wu, Junyi, et al.
Pubblicazione: (2025)
Self-Explainable Affordance Learning with Embodied Caption
di: Zhang, Zhipeng, et al.
Pubblicazione: (2024)
di: Zhang, Zhipeng, et al.
Pubblicazione: (2024)
Deep Equilibrium Diffusion Restoration with Parallel Sampling
di: Cao, Jiezhang, et al.
Pubblicazione: (2023)
di: Cao, Jiezhang, et al.
Pubblicazione: (2023)
Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution
di: Zhang, Xun, et al.
Pubblicazione: (2026)
di: Zhang, Xun, et al.
Pubblicazione: (2026)
TrafficBots V1.5: Traffic Simulation via Conditional VAEs and Transformers with Relative Pose Encoding
di: Zhang, Zhejun, et al.
Pubblicazione: (2024)
di: Zhang, Zhejun, et al.
Pubblicazione: (2024)
Low-Light Image Enhancement using Event-Based Illumination Estimation
di: Sun, Lei, et al.
Pubblicazione: (2025)
di: Sun, Lei, et al.
Pubblicazione: (2025)
Binarized Diffusion Model for Image Super-Resolution
di: Chen, Zheng, et al.
Pubblicazione: (2024)
di: Chen, Zheng, et al.
Pubblicazione: (2024)
RobuQ: Pushing DiTs to W1.58A2 via Robust Activation Quantization
di: Yang, Kaicheng, et al.
Pubblicazione: (2025)
di: Yang, Kaicheng, et al.
Pubblicazione: (2025)
Test-time Training for Hyperspectral Image Super-resolution
di: Li, Ke, et al.
Pubblicazione: (2024)
di: Li, Ke, et al.
Pubblicazione: (2024)
QuantSR+: Pushing the Limit of Quantized Image Super-Resolution Networks
di: Qin, Haotong, et al.
Pubblicazione: (2026)
di: Qin, Haotong, et al.
Pubblicazione: (2026)
Know Your Neighbors: Improving Single-View Reconstruction via Spatial Vision-Language Reasoning
di: Li, Rui, et al.
Pubblicazione: (2024)
di: Li, Rui, et al.
Pubblicazione: (2024)
Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models
di: Zhong, Yi, et al.
Pubblicazione: (2026)
di: Zhong, Yi, et al.
Pubblicazione: (2026)
CAFuser: Condition-Aware Multimodal Fusion for Robust Semantic Perception of Driving Scenes
di: Broedermann, Tim, et al.
Pubblicazione: (2024)
di: Broedermann, Tim, et al.
Pubblicazione: (2024)
TreeQ: Pushing the Quantization Boundary of Diffusion Transformer via Tree-Structured Mixed-Precision Search
di: Yang, Kaicheng, et al.
Pubblicazione: (2025)
di: Yang, Kaicheng, et al.
Pubblicazione: (2025)
QArtSR: Quantization via Reverse-Module and Timestep-Retraining in One-Step Diffusion based Image Super-Resolution
di: Zhu, Libo, et al.
Pubblicazione: (2025)
di: Zhu, Libo, et al.
Pubblicazione: (2025)
PassionSR: Post-Training Quantization with Adaptive Scale in One-Step Diffusion based Image Super-Resolution
di: Zhu, Libo, et al.
Pubblicazione: (2024)
di: Zhu, Libo, et al.
Pubblicazione: (2024)
Vision Transformers with Hierarchical Attention
di: Liu, Yun, et al.
Pubblicazione: (2021)
di: Liu, Yun, et al.
Pubblicazione: (2021)
Four Ways to Improve Verbo-visual Fusion for Dense 3D Visual Grounding
di: Unal, Ozan, et al.
Pubblicazione: (2023)
di: Unal, Ozan, et al.
Pubblicazione: (2023)
Learning to Prompt with Text Only Supervision for Vision-Language Models
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
Event-Priori-Based Vision-Language Model for Efficient Visual Understanding
di: Qin, Haotong, et al.
Pubblicazione: (2025)
di: Qin, Haotong, et al.
Pubblicazione: (2025)
MOBIUS: Big-to-Mobile Universal Instance Segmentation via Multi-modal Bottleneck Fusion and Calibrated Decoder Pruning
di: Segu, Mattia, et al.
Pubblicazione: (2025)
di: Segu, Mattia, et al.
Pubblicazione: (2025)
Sun Off, Lights On: Photorealistic Monocular Nighttime Simulation for Robust Semantic Perception
di: Tzevelekakis, Konstantinos, et al.
Pubblicazione: (2024)
di: Tzevelekakis, Konstantinos, et al.
Pubblicazione: (2024)
AdaSVD: Adaptive Singular Value Decomposition for Large Language Models
di: Li, Zhiteng, et al.
Pubblicazione: (2025)
di: Li, Zhiteng, et al.
Pubblicazione: (2025)
Vision encoders should be image size agnostic and task driven
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2025)
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2025)
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
di: Qin, Guangshuo, et al.
Pubblicazione: (2026)
di: Qin, Guangshuo, et al.
Pubblicazione: (2026)
LocalViT: Analyzing Locality in Vision Transformers
di: Li, Yawei, et al.
Pubblicazione: (2021)
di: Li, Yawei, et al.
Pubblicazione: (2021)
Enhanced Multi-Scale Cross-Attention for Person Image Generation
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
2DQuant: Low-bit Post-Training Quantization for Image Super-Resolution
di: Liu, Kai, et al.
Pubblicazione: (2024)
di: Liu, Kai, et al.
Pubblicazione: (2024)
MatIR: A Hybrid Mamba-Transformer Image Restoration Model
di: Wen, Juan, et al.
Pubblicazione: (2025)
di: Wen, Juan, et al.
Pubblicazione: (2025)
DGFusion: Depth-Guided Sensor Fusion for Robust Semantic Perception
di: Broedermannn, Tim, et al.
Pubblicazione: (2025)
di: Broedermannn, Tim, et al.
Pubblicazione: (2025)
BinaryHPE: 3D Human Pose and Shape Estimation via Binarization
di: Li, Zhiteng, et al.
Pubblicazione: (2023)
di: Li, Zhiteng, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Retinex-MEF: Retinex-based Glare Effects Aware Unsupervised Multi-Exposure Image Fusion
di: Bai, Haowen, et al.
Pubblicazione: (2025) -
Deep Unfolding Multi-modal Image Fusion Network via Attribution Analysis
di: Bai, Haowen, et al.
Pubblicazione: (2025) -
ReFusion: Learning Image Fusion from Reconstruction with Learnable Loss via Meta-Learning
di: Bai, Haowen, et al.
Pubblicazione: (2023) -
Task-driven Image Fusion with Learnable Fusion Loss
di: Bai, Haowen, et al.
Pubblicazione: (2024) -
Equivariant Multi-Modality Image Fusion
di: Zhao, Zixiang, et al.
Pubblicazione: (2023)