Saved in:
| Main Authors: | Liu, Bangwei, Bao, Yicheng, Lin, Shaohui, Wang, Xuhong, Tan, Xin, Wang, Yingchun, Xie, Yuan, Lu, Chaochao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2504.00954 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration
by: Wang, Sen, et al.
Published: (2026)
by: Wang, Sen, et al.
Published: (2026)
World2Minecraft: Occupancy-Driven Simulated Scenes Construction
by: Zhang, Lechao, et al.
Published: (2026)
by: Zhang, Lechao, et al.
Published: (2026)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
by: Bao, Yicheng, et al.
Published: (2026)
by: Bao, Yicheng, et al.
Published: (2026)
FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation
by: Tian, Qijian, et al.
Published: (2025)
by: Tian, Qijian, et al.
Published: (2025)
MUVR: A Multi-Modal Untrimmed Video Retrieval Benchmark with Multi-Level Visual Correspondence
by: Feng, Yue, et al.
Published: (2025)
by: Feng, Yue, et al.
Published: (2025)
Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
by: Zhou, Yikang, et al.
Published: (2025)
by: Zhou, Yikang, et al.
Published: (2025)
DailyArt: Discovering Articulation from Single Static Images via Latent Dynamics
by: Zhang, Hang, et al.
Published: (2026)
by: Zhang, Hang, et al.
Published: (2026)
Robust Remote Sensing Image-Text Retrieval with Noisy Correspondence
by: Song, Qiya, et al.
Published: (2026)
by: Song, Qiya, et al.
Published: (2026)
Role-SynthCLIP: A Role Play Driven Diverse Synthetic Data Approach
by: Huangfu, Yuanxiang, et al.
Published: (2025)
by: Huangfu, Yuanxiang, et al.
Published: (2025)
TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios
by: Yu, Qiucheng, et al.
Published: (2026)
by: Yu, Qiucheng, et al.
Published: (2026)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
by: Wang, Yixu, et al.
Published: (2025)
by: Wang, Yixu, et al.
Published: (2025)
Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval
by: Zhang, Guosheng, et al.
Published: (2026)
by: Zhang, Guosheng, et al.
Published: (2026)
Towards General Multimodal Visual Tracking
by: Lu, Andong, et al.
Published: (2025)
by: Lu, Andong, et al.
Published: (2025)
CorrAdaptor: Adaptive Local Context Learning for Correspondence Pruning
by: Zhu, Wei, et al.
Published: (2024)
by: Zhu, Wei, et al.
Published: (2024)
Attention-Driven Multimodal Alignment for Long-term Action Quality Assessment
by: Wang, Xin, et al.
Published: (2025)
by: Wang, Xin, et al.
Published: (2025)
ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation
by: Zhou, Shizhe, et al.
Published: (2026)
by: Zhou, Shizhe, et al.
Published: (2026)
Towards LLM-centric Affective Visual Customization via Efficient and Precise Emotion Manipulating
by: Luo, Jiamin, et al.
Published: (2026)
by: Luo, Jiamin, et al.
Published: (2026)
Leveraging Consistent Spatio-Temporal Correspondence for Robust Visual Odometry
by: Zhang, Zhaoxing, et al.
Published: (2024)
by: Zhang, Zhaoxing, et al.
Published: (2024)
Towards Real-Time Open-Vocabulary Video Instance Segmentation
by: Yan, Bin, et al.
Published: (2024)
by: Yan, Bin, et al.
Published: (2024)
AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation
by: Hu, Rongsheng, et al.
Published: (2026)
by: Hu, Rongsheng, et al.
Published: (2026)
COVE: Unleashing the Diffusion Feature Correspondence for Consistent Video Editing
by: Wang, Jiangshan, et al.
Published: (2024)
by: Wang, Jiangshan, et al.
Published: (2024)
RzenEmbed: Towards Comprehensive Multimodal Retrieval
by: Jian, Weijian, et al.
Published: (2025)
by: Jian, Weijian, et al.
Published: (2025)
VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
by: Jiang, Tianxiang, et al.
Published: (2025)
by: Jiang, Tianxiang, et al.
Published: (2025)
Learning Instance-Aware Correspondences for Robust Multi-Instance Point Cloud Registration in Cluttered Scenes
by: Yu, Zhiyuan, et al.
Published: (2024)
by: Yu, Zhiyuan, et al.
Published: (2024)
Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding
by: Jiang, Yuheng, et al.
Published: (2026)
by: Jiang, Yuheng, et al.
Published: (2026)
IDCNet: Guided Video Diffusion for Metric-Consistent RGBD Scene Generation with Precise Camera Control
by: Liu, Lijuan, et al.
Published: (2025)
by: Liu, Lijuan, et al.
Published: (2025)
CREM: Compression-Driven Representation Enhancement for Multimodal Retrieval and Comprehension
by: Liu, Lihao, et al.
Published: (2026)
by: Liu, Lihao, et al.
Published: (2026)
PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval
by: Xu, Tianyi, et al.
Published: (2026)
by: Xu, Tianyi, et al.
Published: (2026)
Class Agnostic Instance-level Descriptor for Visual Instance Search
by: Sun, Qi-Ying, et al.
Published: (2025)
by: Sun, Qi-Ying, et al.
Published: (2025)
Resolving Symmetry Ambiguity in Correspondence-based Methods for Instance-level Object Pose Estimation
by: Lin, Yongliang, et al.
Published: (2024)
by: Lin, Yongliang, et al.
Published: (2024)
CNN-Based Camera Pose Estimation and Localisation of Scan Images for Aircraft Visual Inspection
by: Oh, Xueyan, et al.
Published: (2025)
by: Oh, Xueyan, et al.
Published: (2025)
IFTR: An Instance-Level Fusion Transformer for Visual Collaborative Perception
by: Wang, Shaohong, et al.
Published: (2024)
by: Wang, Shaohong, et al.
Published: (2024)
USIS16K: High-Quality Dataset for Underwater Salient Instance Segmentation
by: Hong, Lin, et al.
Published: (2025)
by: Hong, Lin, et al.
Published: (2025)
Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation
by: Eldesokey, Abdelrahman, et al.
Published: (2025)
by: Eldesokey, Abdelrahman, et al.
Published: (2025)
Referring Expression Instance Retrieval and A Strong End-to-End Baseline
by: Hao, Xiangzhao, et al.
Published: (2025)
by: Hao, Xiangzhao, et al.
Published: (2025)
TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation
by: You, Ling, et al.
Published: (2025)
by: You, Ling, et al.
Published: (2025)
Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
by: Chen, Meiqi, et al.
Published: (2024)
by: Chen, Meiqi, et al.
Published: (2024)
PS-ReID: Advancing Person Re-Identification and Precise Segmentation with Multimodal Retrieval
by: Yan, Jincheng, et al.
Published: (2025)
by: Yan, Jincheng, et al.
Published: (2025)
ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension
by: Xu, Duo, et al.
Published: (2025)
by: Xu, Duo, et al.
Published: (2025)
Point-Supervised Facial Expression Spotting with Gaussian-Based Instance-Adaptive Intensity Modeling
by: Deng, Yicheng, et al.
Published: (2025)
by: Deng, Yicheng, et al.
Published: (2025)
Similar Items
-
Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration
by: Wang, Sen, et al.
Published: (2026) -
World2Minecraft: Occupancy-Driven Simulated Scenes Construction
by: Zhang, Lechao, et al.
Published: (2026) -
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
by: Bao, Yicheng, et al.
Published: (2026) -
FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation
by: Tian, Qijian, et al.
Published: (2025) -
MUVR: A Multi-Modal Untrimmed Video Retrieval Benchmark with Multi-Level Visual Correspondence
by: Feng, Yue, et al.
Published: (2025)