Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Jia, Haonan, Dong, Shichao, Dong, Xin, Sun, Zenghui, Wang, Jin, Lan, Jinsong, Zhu, Xiaoyong, Zheng, Bo, Zhang, Kaifu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling
por: Dong, Xin, et al.
Publicado: (2025)
por: Dong, Xin, et al.
Publicado: (2025)
REVISION:Reflective Intent Mining and Online Reasoning Auxiliary for E-commerce Visual Search System Optimization
por: Tang, Yiwen, et al.
Publicado: (2025)
por: Tang, Yiwen, et al.
Publicado: (2025)
iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance
por: Zheng, Jun, et al.
Publicado: (2026)
por: Zheng, Jun, et al.
Publicado: (2026)
MMKB-RAG: A Multi-Modal Knowledge-Based Retrieval-Augmented Generation Framework
por: Ling, Zihan, et al.
Publicado: (2025)
por: Ling, Zihan, et al.
Publicado: (2025)
Explore More, Learn Better: Parallel MLLM Embeddings under Mutual Information Minimization
por: Wang, Zhicheng, et al.
Publicado: (2025)
por: Wang, Zhicheng, et al.
Publicado: (2025)
Towards RGB-NIR Cross-modality Image Registration and Beyond
por: Li, Huadong, et al.
Publicado: (2024)
por: Li, Huadong, et al.
Publicado: (2024)
Start from Video-Music Retrieval: An Inter-Intra Modal Loss for Cross Modal Retrieval
por: Chen, Zeyu, et al.
Publicado: (2024)
por: Chen, Zeyu, et al.
Publicado: (2024)
Enhancing Sequential Recommendation with World Knowledge from Large Language Models
por: Dai, Tianjie, et al.
Publicado: (2025)
por: Dai, Tianjie, et al.
Publicado: (2025)
FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization
por: Song, Quanjian, et al.
Publicado: (2026)
por: Song, Quanjian, et al.
Publicado: (2026)
Improving Container Port Efficiency: A Data‐Driven Model for Optimizing Truck Arrival Appointments Through Distributionally Robust Optimization
por: Shichao Sun, et al.
Publicado: (2025)
por: Shichao Sun, et al.
Publicado: (2025)
Towards Cross-Modal Text-Molecule Retrieval with Better Modality Alignment
por: Song, Jia, et al.
Publicado: (2024)
por: Song, Jia, et al.
Publicado: (2024)
A Low-rank Matching Attention based Cross-modal Feature Fusion Method for Conversational Emotion Recognition
por: Shou, Yuntao, et al.
Publicado: (2023)
por: Shou, Yuntao, et al.
Publicado: (2023)
Self Identity Mapping
por: Cai, Xiuding, et al.
Publicado: (2025)
por: Cai, Xiuding, et al.
Publicado: (2025)
Cross-Modal Distillation For Widely Differing Modalities
por: Zhao, Cairong, et al.
Publicado: (2025)
por: Zhao, Cairong, et al.
Publicado: (2025)
Information and communications technologies for carbon sinks from economics and engineering perspectives
por: Dong, Yuze, et al.
Publicado: (2026)
por: Dong, Yuze, et al.
Publicado: (2026)
Mobile UMI: Cross-View Diffusion Policy with Decoupled Kinematics for Mobile Manipulation
por: Huang, Haoran, et al.
Publicado: (2026)
por: Huang, Haoran, et al.
Publicado: (2026)
Dynamic Adapter with Semantics Disentangling for Cross-lingual Cross-modal Retrieval
por: Cai, Rui, et al.
Publicado: (2024)
por: Cai, Rui, et al.
Publicado: (2024)
Leveraging Scene Context with Dual Networks for Sequential User Behavior Modeling
por: Chen, Xu, et al.
Publicado: (2025)
por: Chen, Xu, et al.
Publicado: (2025)
Pailitao-VL: Unified Embedding and Reranker for Real-Time Multi-Modal Industrial Search
por: Chen, Lei, et al.
Publicado: (2026)
por: Chen, Lei, et al.
Publicado: (2026)
AuroRA: Breaking Low-Rank Bottleneck of LoRA with Nonlinear Mapping
por: Dong, Haonan, et al.
Publicado: (2025)
por: Dong, Haonan, et al.
Publicado: (2025)
Networked Restless Multi-Arm Bandits with Reinforcement Learning
por: Zhang, Hanmo, et al.
Publicado: (2025)
por: Zhang, Hanmo, et al.
Publicado: (2025)
Learning Multi-Branch Cooperation for Enhanced Click-Through Rate Prediction at Taobao
por: Chen, Xu, et al.
Publicado: (2024)
por: Chen, Xu, et al.
Publicado: (2024)
e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings
por: Chen, Haonan, et al.
Publicado: (2026)
por: Chen, Haonan, et al.
Publicado: (2026)
ICFNet: Integrated Cross-modal Fusion Network for Survival Prediction
por: Zhang, Binyu, et al.
Publicado: (2025)
por: Zhang, Binyu, et al.
Publicado: (2025)
Balanced Multi-modal Federated Learning via Cross-Modal Infiltration
por: Fan, Yunfeng, et al.
Publicado: (2023)
por: Fan, Yunfeng, et al.
Publicado: (2023)
Cross-modal Prompting for Balanced Incomplete Multi-modal Emotion Recognition
por: He, Wen-Jue, et al.
Publicado: (2025)
por: He, Wen-Jue, et al.
Publicado: (2025)
A Review of Detection, Evolution, and Data Reconstruction Strategies for False Data Injection Attacks in Power Cyber-Physical Systems
por: Bo, Xiaoyong
Publicado: (2025)
por: Bo, Xiaoyong
Publicado: (2025)
Cellulose‐Reinforced Bilayer Hydrogel Actuator With Solvent‐Responsiveness
por: Zenghui Li, et al.
Publicado: (2026)
por: Zenghui Li, et al.
Publicado: (2026)
Learnable Cross-modal Knowledge Distillation for Multi-modal Learning with Missing Modality
por: Wang, Hu, et al.
Publicado: (2023)
por: Wang, Hu, et al.
Publicado: (2023)
Network Embedding via Deep Prediction Model
por: Sun, Xin, et al.
Publicado: (2021)
por: Sun, Xin, et al.
Publicado: (2021)
Cross-Modal Retrieval for Motion and Text via DropTriple Loss
por: Yan, Sheng, et al.
Publicado: (2023)
por: Yan, Sheng, et al.
Publicado: (2023)
Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
por: Lan, Tian, et al.
Publicado: (2025)
por: Lan, Tian, et al.
Publicado: (2025)
Rethinking Adam for Time Series Forecasting: A Simple Heuristic to Improve Optimization under Distribution Shifts
por: Dong, Yuze, et al.
Publicado: (2026)
por: Dong, Yuze, et al.
Publicado: (2026)
Quasinormal modes of charged covariant effective black holes with a cosmological constant
por: Dong, Zhongzhinan, et al.
Publicado: (2026)
por: Dong, Zhongzhinan, et al.
Publicado: (2026)
CrossWeaver: Cross-modal Weaving for Arbitrary-Modality Semantic Segmentation
por: Zhang, Zelin, et al.
Publicado: (2026)
por: Zhang, Zelin, et al.
Publicado: (2026)
Fusion-Mamba for Cross-modality Object Detection
por: Dong, Wenhao, et al.
Publicado: (2024)
por: Dong, Wenhao, et al.
Publicado: (2024)
Explicitly Guided Information Interaction Network for Cross-modal Point Cloud Completion
por: Xu, Hang, et al.
Publicado: (2024)
por: Xu, Hang, et al.
Publicado: (2024)
MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval
por: Lei, Youbo, et al.
Publicado: (2023)
por: Lei, Youbo, et al.
Publicado: (2023)
Dual-Level Cross-Modal Contrastive Clustering
por: Zhang, Haixin, et al.
Publicado: (2024)
por: Zhang, Haixin, et al.
Publicado: (2024)
BadToken: Token-level Backdoor Attacks to Multi-modal Large Language Models
por: Yuan, Zenghui, et al.
Publicado: (2025)
por: Yuan, Zenghui, et al.
Publicado: (2025)
Ejemplares similares
-
INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling
por: Dong, Xin, et al.
Publicado: (2025) -
REVISION:Reflective Intent Mining and Online Reasoning Auxiliary for E-commerce Visual Search System Optimization
por: Tang, Yiwen, et al.
Publicado: (2025) -
iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance
por: Zheng, Jun, et al.
Publicado: (2026) -
MMKB-RAG: A Multi-Modal Knowledge-Based Retrieval-Augmented Generation Framework
por: Ling, Zihan, et al.
Publicado: (2025) -
Explore More, Learn Better: Parallel MLLM Embeddings under Mutual Information Minimization
por: Wang, Zhicheng, et al.
Publicado: (2025)