FreeRet: MLLMs as Training-Free Retrievers
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Yuhan, Zeng, Xiangyu, Wang, Chenting, Li, Xinhao, Liu, Chunxu, Xu, Yicheng, Yan, Ziang, Wang, Yi, Wang, Limin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
di: Wang, Chenting, et al.
Pubblicazione: (2025)
di: Wang, Chenting, et al.
Pubblicazione: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
Make Your Training Flexible: Towards Deployment-Efficient Video Models
di: Wang, Chenting, et al.
Pubblicazione: (2025)
di: Wang, Chenting, et al.
Pubblicazione: (2025)
InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
di: Yan, Ziang, et al.
Pubblicazione: (2024)
di: Yan, Ziang, et al.
Pubblicazione: (2024)
ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video
di: Li, Xinhao, et al.
Pubblicazione: (2023)
di: Li, Xinhao, et al.
Pubblicazione: (2023)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
di: Yan, Ziang, et al.
Pubblicazione: (2025)
di: Yan, Ziang, et al.
Pubblicazione: (2025)
VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling
di: Li, Xinhao, et al.
Pubblicazione: (2024)
di: Li, Xinhao, et al.
Pubblicazione: (2024)
Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
di: Li, Xinhao, et al.
Pubblicazione: (2025)
di: Li, Xinhao, et al.
Pubblicazione: (2025)
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2026)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2026)
StreamForest: Efficient Online Video Understanding with Persistent Event Memory
di: Zeng, Xiangyu, et al.
Pubblicazione: (2025)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2025)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
SORCE: Small Object Retrieval in Complex Environments
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
di: Liu, Chunxu, et al.
Pubblicazione: (2025)
Training-Free Reasoning and Reflection in MLLMs
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
History-Aware Transformation of ReID Features for Multiple Object Tracking
di: Gao, Ruopeng, et al.
Pubblicazione: (2025)
di: Gao, Ruopeng, et al.
Pubblicazione: (2025)
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking
di: Meng, Desen, et al.
Pubblicazione: (2025)
di: Meng, Desen, et al.
Pubblicazione: (2025)
ActErase: A Training-Free Paradigm for Precise Concept Erasure via Activation Redirection
di: Sun, Yi, et al.
Pubblicazione: (2026)
di: Sun, Yi, et al.
Pubblicazione: (2026)
VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
di: Jiang, Tianxiang, et al.
Pubblicazione: (2025)
di: Jiang, Tianxiang, et al.
Pubblicazione: (2025)
Sparse Global Matching for Video Frame Interpolation with Large Motion
di: Liu, Chunxu, et al.
Pubblicazione: (2024)
di: Liu, Chunxu, et al.
Pubblicazione: (2024)
Differential Vector Erasure: Unified Training-Free Concept Erasure for Flow Matching Models
di: Zhang, Zhiqi, et al.
Pubblicazione: (2026)
di: Zhang, Zhiqi, et al.
Pubblicazione: (2026)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
di: Wang, Yi, et al.
Pubblicazione: (2024)
di: Wang, Yi, et al.
Pubblicazione: (2024)
Training-Free Personalization via Retrieval and Reasoning on Fingerprints
di: Das, Deepayan, et al.
Pubblicazione: (2025)
di: Das, Deepayan, et al.
Pubblicazione: (2025)
Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation
di: Han, Su Ho, et al.
Pubblicazione: (2025)
di: Han, Su Ho, et al.
Pubblicazione: (2025)
VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model
di: Li, Xinhao, et al.
Pubblicazione: (2024)
di: Li, Xinhao, et al.
Pubblicazione: (2024)
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
di: Dong, Lu, et al.
Pubblicazione: (2025)
di: Dong, Lu, et al.
Pubblicazione: (2025)
Training-Free Pretrained Model Merging
di: Xu, Zhengqi, et al.
Pubblicazione: (2024)
di: Xu, Zhengqi, et al.
Pubblicazione: (2024)
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024)
di: Li, Kunchang, et al.
Pubblicazione: (2024)
RetCompletion:High-Speed Inference Image Completion with Retentive Network
di: Cang, Yueyang, et al.
Pubblicazione: (2024)
di: Cang, Yueyang, et al.
Pubblicazione: (2024)
Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval
di: Wang, Tong, et al.
Pubblicazione: (2026)
di: Wang, Tong, et al.
Pubblicazione: (2026)
Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
ParkingTwin: Training-Free Streaming 3D Reconstruction for Parking-Lot Digital Twins
di: Liu, Xinhao, et al.
Pubblicazione: (2026)
di: Liu, Xinhao, et al.
Pubblicazione: (2026)
RIVER: A Real-Time Interaction Benchmark for Video LLMs
di: Shi, Yansong, et al.
Pubblicazione: (2026)
di: Shi, Yansong, et al.
Pubblicazione: (2026)
VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
TTSA3R: Training-Free Temporal-Spatial Adaptive Persistent State for Streaming 3D Reconstruction
di: Zheng, Zhijie, et al.
Pubblicazione: (2026)
di: Zheng, Zhijie, et al.
Pubblicazione: (2026)
EventVAD: Training-Free Event-Aware Video Anomaly Detection
di: Shao, Yihua, et al.
Pubblicazione: (2025)
di: Shao, Yihua, et al.
Pubblicazione: (2025)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
di: Xu, Yifan, et al.
Pubblicazione: (2024)
di: Xu, Yifan, et al.
Pubblicazione: (2024)
From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information
di: Jiao, Qirui, et al.
Pubblicazione: (2024)
di: Jiao, Qirui, et al.
Pubblicazione: (2024)
WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval
di: Wang, Tianyue, et al.
Pubblicazione: (2026)
di: Wang, Tianyue, et al.
Pubblicazione: (2026)
GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing
di: Zhu, Zifeng, et al.
Pubblicazione: (2026)
di: Zhu, Zifeng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
di: Wang, Chenting, et al.
Pubblicazione: (2025) -
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024) -
Make Your Training Flexible: Towards Deployment-Efficient Video Models
di: Wang, Chenting, et al.
Pubblicazione: (2025) -
InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling
di: Wang, Yi, et al.
Pubblicazione: (2025) -
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
di: Yan, Ziang, et al.
Pubblicazione: (2024)