Test-time adaptation for image compression with distribution regularization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Kecheng, Zhang, Pingping, Qin, Tiexin, Wang, Shiqi, Yan, Hong, Li, Haoliang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
par: Zhang, Pingping, et autres
Publié: (2024)
par: Zhang, Pingping, et autres
Publié: (2024)
M3FAS: An Accurate and Robust MultiModal Mobile Face Anti-Spoofing System
par: Kong, Chenqi, et autres
Publié: (2023)
par: Kong, Chenqi, et autres
Publié: (2023)
Signal: Selective Interaction and Global-local Alignment for Multi-Modal Object Re-Identification
par: Liu, Yangyang, et autres
Publié: (2025)
par: Liu, Yangyang, et autres
Publié: (2025)
Fantastic Animals and Where to Find Them: Segment Any Marine Animal with Dual SAM
par: Zhang, Pingping, et autres
Publié: (2024)
par: Zhang, Pingping, et autres
Publié: (2024)
Multi-Scale and Detail-Enhanced Segment Anything Model for Salient Object Detection
par: Gao, Shixuan, et autres
Publié: (2024)
par: Gao, Shixuan, et autres
Publié: (2024)
Other Tokens Matter: Exploring Global and Local Features of Vision Transformers for Object Re-Identification
par: Wang, Yingquan, et autres
Publié: (2024)
par: Wang, Yingquan, et autres
Publié: (2024)
Towards Open-Vocabulary Remote Sensing Image Semantic Segmentation
par: Ye, Chengyang, et autres
Publié: (2024)
par: Ye, Chengyang, et autres
Publié: (2024)
IDEA: Inverted Text with Cooperative Deformable Aggregation for Multi-modal Object Re-Identification
par: Wang, Yuhao, et autres
Publié: (2025)
par: Wang, Yuhao, et autres
Publié: (2025)
MambaPro: Multi-Modal Object Re-Identification with Mamba Aggregation and Synergistic Prompt
par: Wang, Yuhao, et autres
Publié: (2024)
par: Wang, Yuhao, et autres
Publié: (2024)
Deep Shape-Texture Statistics for Completely Blind Image Quality Evaluation
par: Li, Yixuan, et autres
Publié: (2024)
par: Li, Yixuan, et autres
Publié: (2024)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
T$^\text{3}$SVFND: Towards an Evolving Fake News Detector for Emergencies with Test-time Training on Short Video Platforms
par: Zhang, Liyuan, et autres
Publié: (2025)
par: Zhang, Liyuan, et autres
Publié: (2025)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
par: Zhao, Haochen, et autres
Publié: (2025)
par: Zhao, Haochen, et autres
Publié: (2025)
SPC-NeRF: Spatial Predictive Compression for Voxel Based Radiance Field
par: Song, Zetian, et autres
Publié: (2024)
par: Song, Zetian, et autres
Publié: (2024)
FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models
par: Li, Yixuan, et autres
Publié: (2024)
par: Li, Yixuan, et autres
Publié: (2024)
MVPbev: Multi-view Perspective Image Generation from BEV with Test-time Controllability and Generalizability
par: Liu, Buyu, et autres
Publié: (2024)
par: Liu, Buyu, et autres
Publié: (2024)
Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion
par: Zhu, Yixin, et autres
Publié: (2026)
par: Zhu, Yixin, et autres
Publié: (2026)
Unified Coding for Both Human Perception and Generalized Machine Analytics with CLIP Supervision
par: Yin, Kangsheng, et autres
Publié: (2025)
par: Yin, Kangsheng, et autres
Publié: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
par: Zhang, Pingping, et autres
Publié: (2024)
par: Zhang, Pingping, et autres
Publié: (2024)
4D Gaussian Splatting with Scale-aware Residual Field and Adaptive Optimization for Real-time Rendering of Temporally Complex Dynamic Scenes
par: Yan, Jinbo, et autres
Publié: (2024)
par: Yan, Jinbo, et autres
Publié: (2024)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
par: Hu, Xiaowan, et autres
Publié: (2024)
par: Hu, Xiaowan, et autres
Publié: (2024)
Tile Classification Based Viewport Prediction with Multi-modal Fusion Transformer
par: Zhang, Zhihao, et autres
Publié: (2023)
par: Zhang, Zhihao, et autres
Publié: (2023)
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
par: Lu, Zhenyu, et autres
Publié: (2025)
par: Lu, Zhenyu, et autres
Publié: (2025)
EDGE-Shield: Efficient Denoising-staGE Shield for Violative Content Filtering via Scalable Reference-Based Matching
par: Taniguchi, Takara, et autres
Publié: (2026)
par: Taniguchi, Takara, et autres
Publié: (2026)
OT-DETECTOR: Delving into Optimal Transport for Zero-shot Out-of-Distribution Detection
par: Liu, Yu, et autres
Publié: (2025)
par: Liu, Yu, et autres
Publié: (2025)
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
par: Chen, Yanzhe, et autres
Publié: (2025)
par: Chen, Yanzhe, et autres
Publié: (2025)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
par: Xu, Zitong, et autres
Publié: (2025)
par: Xu, Zitong, et autres
Publié: (2025)
PlanMoGPT: Flow-Enhanced Progressive Planning for Text to Motion Synthesis
par: Jin, Chuhao, et autres
Publié: (2025)
par: Jin, Chuhao, et autres
Publié: (2025)
D-FCGS: Feedforward Compression of Dynamic Gaussian Splatting for Free-Viewpoint Videos
par: Zhang, Wenkang, et autres
Publié: (2025)
par: Zhang, Wenkang, et autres
Publié: (2025)
DIVE: Inverting Conditional Diffusion Models for Discriminative Tasks
par: Li, Yinqi, et autres
Publié: (2025)
par: Li, Yinqi, et autres
Publié: (2025)
ImagenHub: Standardizing the evaluation of conditional image generation models
par: Ku, Max, et autres
Publié: (2023)
par: Ku, Max, et autres
Publié: (2023)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
par: Tang, Hao, et autres
Publié: (2026)
par: Tang, Hao, et autres
Publié: (2026)
Anisotropic Modality Align
par: Yu, Xiaomin, et autres
Publié: (2026)
par: Yu, Xiaomin, et autres
Publié: (2026)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
par: Yin, Zhiyu, et autres
Publié: (2026)
par: Yin, Zhiyu, et autres
Publié: (2026)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
DanceCamAnimator: Keyframe-Based Controllable 3D Dance Camera Synthesis
par: Wang, Zixuan, et autres
Publié: (2024)
par: Wang, Zixuan, et autres
Publié: (2024)
Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection
par: Zhu, Sa, et autres
Publié: (2026)
par: Zhu, Sa, et autres
Publié: (2026)
Documents similaires
-
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
par: Zhang, Pingping, et autres
Publié: (2024) -
M3FAS: An Accurate and Robust MultiModal Mobile Face Anti-Spoofing System
par: Kong, Chenqi, et autres
Publié: (2023) -
Signal: Selective Interaction and Global-local Alignment for Multi-Modal Object Re-Identification
par: Liu, Yangyang, et autres
Publié: (2025) -
Fantastic Animals and Where to Find Them: Segment Any Marine Animal with Dual SAM
par: Zhang, Pingping, et autres
Publié: (2024) -
Multi-Scale and Detail-Enhanced Segment Anything Model for Salient Object Detection
par: Gao, Shixuan, et autres
Publié: (2024)