Saved in:
| Main Authors: | Wang, Haoran, Pei, Hanyu, Lyu, Yang, Zhang, Kai, Li, Li, Fan, Feng-Lei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2507.11443 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AnyTrans: Translate AnyText in the Image with Large Scale Models
by: Qian, Zhipeng, et al.
Published: (2024)
by: Qian, Zhipeng, et al.
Published: (2024)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
by: Wang, Huanyu, et al.
Published: (2025)
by: Wang, Huanyu, et al.
Published: (2025)
DualComp: End-to-End Learning of a Unified Dual-Modality Lossless Compressor
by: Zhao, Yan, et al.
Published: (2025)
by: Zhao, Yan, et al.
Published: (2025)
StyleVAR: Controllable Image Style Transfer via Visual Autoregressive Modeling
by: Jing, Liqi, et al.
Published: (2026)
by: Jing, Liqi, et al.
Published: (2026)
From Structure to Detail: Hierarchical Distillation for Efficient Diffusion Model
by: Cheng, Hanbo, et al.
Published: (2025)
by: Cheng, Hanbo, et al.
Published: (2025)
Hierarchical Semantic-Visual Fusion of Visible and Near-infrared Images for Long-range Haze Removal
by: Li, Yi, et al.
Published: (2025)
by: Li, Yi, et al.
Published: (2025)
Single Image Unlearning: Efficient Machine Unlearning in Multimodal Large Language Models
by: Li, Jiaqi, et al.
Published: (2024)
by: Li, Jiaqi, et al.
Published: (2024)
HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator
by: Yang, Fan, et al.
Published: (2024)
by: Yang, Fan, et al.
Published: (2024)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
by: Zhang, Shaolei, et al.
Published: (2025)
by: Zhang, Shaolei, et al.
Published: (2025)
You Only Need One Color Space: An Efficient Network for Low-light Image Enhancement
by: Yan, Qingsen, et al.
Published: (2024)
by: Yan, Qingsen, et al.
Published: (2024)
Dual Prompting Image Restoration with Diffusion Transformers
by: Kong, Dehong, et al.
Published: (2025)
by: Kong, Dehong, et al.
Published: (2025)
Learning domain-invariant features through channel-level sparsification for Out-Of Distribution Generalization
by: Pei, Haoran, et al.
Published: (2026)
by: Pei, Haoran, et al.
Published: (2026)
LocationAgent: A Hierarchical Agent for Image Geolocation via Decoupling Strategy and Evidence from Parametric Knowledge
by: Li, Qiujun, et al.
Published: (2026)
by: Li, Qiujun, et al.
Published: (2026)
Image Forgery Localization via Guided Noise and Multi-Scale Feature Aggregation
by: Niu, Yakun, et al.
Published: (2024)
by: Niu, Yakun, et al.
Published: (2024)
HP-Edit: A Human-Preference Post-Training Framework for Image Editing
by: Li, Fan, et al.
Published: (2026)
by: Li, Fan, et al.
Published: (2026)
Hierarchical Prompt Learning for Image- and Text-Based Person Re-Identification
by: Zhou, Linhan, et al.
Published: (2025)
by: Zhou, Linhan, et al.
Published: (2025)
AUG: A New Dataset and An Efficient Model for Aerial Image Urban Scene Graph Generation
by: Li, Yansheng, et al.
Published: (2024)
by: Li, Yansheng, et al.
Published: (2024)
OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding
by: Tao, Haoyi, et al.
Published: (2026)
by: Tao, Haoyi, et al.
Published: (2026)
Towards Robust Probabilistic Modeling on SO(3) via Rotation Laplace Distribution
by: Yin, Yingda, et al.
Published: (2023)
by: Yin, Yingda, et al.
Published: (2023)
PATHS: A Hierarchical Transformer for Efficient Whole Slide Image Analysis
by: Buzzard, Zak, et al.
Published: (2024)
by: Buzzard, Zak, et al.
Published: (2024)
Instant Preference Alignment for Text-to-Image Diffusion Models
by: Li, Yang, et al.
Published: (2025)
by: Li, Yang, et al.
Published: (2025)
Restoration Adaptation for Semantic Segmentation on Low Quality Images
by: Guan, Kai, et al.
Published: (2026)
by: Guan, Kai, et al.
Published: (2026)
PostEdit: Posterior Sampling for Efficient Zero-Shot Image Editing
by: Tian, Feng, et al.
Published: (2024)
by: Tian, Feng, et al.
Published: (2024)
PAR: Prompt-Aware Token Reduction Method for Efficient Large Multimodal Models
by: Liu, Yingen, et al.
Published: (2024)
by: Liu, Yingen, et al.
Published: (2024)
Semantic Communication based on Large Language Model for Underwater Image Transmission
by: Chen, Weilong, et al.
Published: (2024)
by: Chen, Weilong, et al.
Published: (2024)
Dog-IQA: Standard-guided Zero-shot MLLM for Mix-grained Image Quality Assessment
by: Liu, Kai, et al.
Published: (2024)
by: Liu, Kai, et al.
Published: (2024)
HRGS: Hierarchical Gaussian Splatting for Memory-Efficient High-Resolution 3D Reconstruction
by: Li, Changbai, et al.
Published: (2025)
by: Li, Changbai, et al.
Published: (2025)
Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor
by: Kim, Yeonju, et al.
Published: (2024)
by: Kim, Yeonju, et al.
Published: (2024)
RACap: Relation-Aware Prompting for Lightweight Retrieval-Augmented Image Captioning
by: Long, Xiaosheng, et al.
Published: (2025)
by: Long, Xiaosheng, et al.
Published: (2025)
Efficient Multimodal Large Language Models: A Survey
by: Jin, Yizhang, et al.
Published: (2024)
by: Jin, Yizhang, et al.
Published: (2024)
CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating
by: Wang, Jiyuan, et al.
Published: (2026)
by: Wang, Jiyuan, et al.
Published: (2026)
TSVC:Tripartite Learning with Semantic Variation Consistency for Robust Image-Text Retrieval
by: Lyu, Shuai, et al.
Published: (2025)
by: Lyu, Shuai, et al.
Published: (2025)
Transferable Adversarial Facial Images for Privacy Protection
by: Li, Minghui, et al.
Published: (2024)
by: Li, Minghui, et al.
Published: (2024)
Efficient Large-Deformation Medical Image Registration via Recurrent Dynamic Correlation
by: Li, Tianran, et al.
Published: (2025)
by: Li, Tianran, et al.
Published: (2025)
HierarchicalPrune: Position-Aware Compression for Large-Scale Diffusion Models
by: Kwon, Young D., et al.
Published: (2025)
by: Kwon, Young D., et al.
Published: (2025)
HGTS-Former: Hierarchical HyperGraph Transformer for Multivariate Time Series Analysis
by: Si, Hao, et al.
Published: (2025)
by: Si, Hao, et al.
Published: (2025)
HIMOSA: Efficient Remote Sensing Image Super-Resolution with Hierarchical Mixture of Sparse Attention
by: Liu, Yi, et al.
Published: (2025)
by: Liu, Yi, et al.
Published: (2025)
FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories
by: Ke, Lei, et al.
Published: (2025)
by: Ke, Lei, et al.
Published: (2025)
PriorNet: A Novel Lightweight Network with Multidimensional Interactive Attention for Efficient Image Dehazing
by: Chen, Yutong, et al.
Published: (2024)
by: Chen, Yutong, et al.
Published: (2024)
M2-Encoder: Advancing Bilingual Image-Text Understanding by Large-scale Efficient Pretraining
by: Guo, Qingpei, et al.
Published: (2024)
by: Guo, Qingpei, et al.
Published: (2024)
Similar Items
-
AnyTrans: Translate AnyText in the Image with Large Scale Models
by: Qian, Zhipeng, et al.
Published: (2024) -
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
by: Wang, Huanyu, et al.
Published: (2025) -
DualComp: End-to-End Learning of a Unified Dual-Modality Lossless Compressor
by: Zhao, Yan, et al.
Published: (2025) -
StyleVAR: Controllable Image Style Transfer via Visual Autoregressive Modeling
by: Jing, Liqi, et al.
Published: (2026) -
From Structure to Detail: Hierarchical Distillation for Efficient Diffusion Model
by: Cheng, Hanbo, et al.
Published: (2025)