Scale, Don't Fine-tune: Guiding Multimodal LLMs for Efficient Visual Place Recognition at Test-Time
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cheng, Jintao, Li, Weibin, Luo, Jiehao, Tang, Xiaoyu, He, Zhijian, Wu, Jin, Zou, Yao, Zhang, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond First-Order: Learning Riemannian Geometries for Invariant Visual Place Recognition
par: Cheng, Jintao, et autres
Publié: (2026)
par: Cheng, Jintao, et autres
Publié: (2026)
OverlapMamba: Novel Shift State Space Model for LiDAR-based Place Recognition
par: Xiang, Qiuchi, et autres
Publié: (2024)
par: Xiang, Qiuchi, et autres
Publié: (2024)
A Pseudo Global Fusion Paradigm-Based Cross-View Network for LiDAR-Based Place Recognition
par: Cheng, Jintao, et autres
Publié: (2025)
par: Cheng, Jintao, et autres
Publié: (2025)
Diversify, Don't Fine-Tune: Scaling Up Visual Recognition Training with Synthetic Images
par: Yu, Zhuoran, et autres
Publié: (2023)
par: Yu, Zhuoran, et autres
Publié: (2023)
Don't Just Fine-tune the Agent, Tune the Environment
par: Lu, Siyuan, et autres
Publié: (2025)
par: Lu, Siyuan, et autres
Publié: (2025)
Grow, Don't Overwrite: Fine-tuning Without Forgetting
par: Adila, Dyah, et autres
Publié: (2026)
par: Adila, Dyah, et autres
Publié: (2026)
Surely Large Multimodal Models (Don't) Excel in Visual Species Recognition?
par: Liu, Tian, et autres
Publié: (2025)
par: Liu, Tian, et autres
Publié: (2025)
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
par: Jia, Hong, et autres
Publié: (2026)
par: Jia, Hong, et autres
Publié: (2026)
MambaFlow: A Novel and Flow-guided State Space Model for Scene Flow Estimation
par: Luo, Jiehao, et autres
Publié: (2025)
par: Luo, Jiehao, et autres
Publié: (2025)
Fine-Tuned LLMs Know They Don't Know: A Parameter-Efficient Approach to Recovering Honesty
par: Shi, Zeyu, et autres
Publié: (2025)
par: Shi, Zeyu, et autres
Publié: (2025)
Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs
par: Kuchibhotla, Hari Chandana, et autres
Publié: (2025)
par: Kuchibhotla, Hari Chandana, et autres
Publié: (2025)
OptiSAR-Net++: A Large-Scale Benchmark and Transformer-Free Framework for Cross-Domain Remote Sensing Visual Grounding
par: Tang, Xiaoyu, et autres
Publié: (2026)
par: Tang, Xiaoyu, et autres
Publié: (2026)
VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization
par: Waheed, Sania, et autres
Publié: (2025)
par: Waheed, Sania, et autres
Publié: (2025)
Don't Forget the Nonlinearity: Unlocking Activation Functions in Efficient Fine-Tuning
par: Yin, Bo, et autres
Publié: (2025)
par: Yin, Bo, et autres
Publié: (2025)
What LLMs Think When You Don't Tell Them What to Think About?
par: Kwon, Yongchan, et autres
Publié: (2026)
par: Kwon, Yongchan, et autres
Publié: (2026)
EDTformer: An Efficient Decoder Transformer for Visual Place Recognition
par: Jin, Tong, et autres
Publié: (2024)
par: Jin, Tong, et autres
Publié: (2024)
Don't Plan for Sick Time
par: Rebecca Weaver
Publié: (2024)
par: Rebecca Weaver
Publié: (2024)
Don't Mind Your Time
par: Rebecca Weaver
Publié: (2025)
par: Rebecca Weaver
Publié: (2025)
Don't Get Me Wrong: How to Apply Deep Visual Interpretations to Time Series
par: Loeffler, Christoffer, et autres
Publié: (2022)
par: Loeffler, Christoffer, et autres
Publié: (2022)
Sample, Don't Search: Rethinking Test-Time Alignment for Language Models
par: Faria, Gonçalo, et autres
Publié: (2025)
par: Faria, Gonçalo, et autres
Publié: (2025)
Don't Use LLMs to Make Relevance Judgments
par: Soboroff, Ian
Publié: (2024)
par: Soboroff, Ian
Publié: (2024)
Don’t Test Twice, It’s All Right
par: Zoe Raglow, et autres
Publié: (2025)
par: Zoe Raglow, et autres
Publié: (2025)
3rd Place Solution to Large-scale Fine-grained Food Recognition
par: Zhong, Yang, et autres
Publié: (2025)
par: Zhong, Yang, et autres
Publié: (2025)
Flexible and Efficient Spatio-Temporal Transformer for Sequential Visual Place Recognition
par: Kiu, Yu, et autres
Publié: (2025)
par: Kiu, Yu, et autres
Publié: (2025)
Structured Pruning for Efficient Visual Place Recognition
par: Grainge, Oliver, et autres
Publié: (2024)
par: Grainge, Oliver, et autres
Publié: (2024)
Diffusion-Based Restoration for Multi-Modal 3D Object Detection in Adverse Weather
par: He, Zhijian, et autres
Publié: (2025)
par: He, Zhijian, et autres
Publié: (2025)
LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models
par: Chen, Yukang, et autres
Publié: (2023)
par: Chen, Yukang, et autres
Publié: (2023)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
par: Li, Juncheng, et autres
Publié: (2023)
par: Li, Juncheng, et autres
Publié: (2023)
Towards Test-time Efficient Visual Place Recognition via Asymmetric Query Processing
par: Kim, Jaeyoon, et autres
Publié: (2025)
par: Kim, Jaeyoon, et autres
Publié: (2025)
Visual Place Recognition for Large-Scale UAV Applications
par: Papapetros, Ioannis Tsampikos, et autres
Publié: (2025)
par: Papapetros, Ioannis Tsampikos, et autres
Publié: (2025)
Don't Get Too Excited -- Eliciting Emotions in LLMs
par: Fazzi, Gino Franco, et autres
Publié: (2025)
par: Fazzi, Gino Franco, et autres
Publié: (2025)
Don't be salesmen
Publié: (1997)
Publié: (1997)
Don't Blink: Evidence Collapse during Multimodal Reasoning
par: Raghu, Suresh, et autres
Publié: (2026)
par: Raghu, Suresh, et autres
Publié: (2026)
Start Making Sense: Libraries Don't Have To Be Confusing Places for Kids with Reading Disabilities.
par: Gorman, Audrey J.
Publié: (1999)
par: Gorman, Audrey J.
Publié: (1999)
"Don't Teach Minerva": Guiding LLMs Through Complex Syntax for Faithful Latin Translation with RAG
par: Aguilar, Sergio Torres
Publié: (2025)
par: Aguilar, Sergio Torres
Publié: (2025)
Distillation Improves Visual Place Recognition for Low Quality Images
par: Yang, Anbang, et autres
Publié: (2023)
par: Yang, Anbang, et autres
Publié: (2023)
Don't Judge a Book by its Cover: Testing LLMs' Robustness Under Logical Obfuscation
par: Borah, Abhilekh, et autres
Publié: (2026)
par: Borah, Abhilekh, et autres
Publié: (2026)
Don't double it: Efficient Agent Prediction in Occlusions
par: Rothenhäusler, Anna, et autres
Publié: (2026)
par: Rothenhäusler, Anna, et autres
Publié: (2026)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
par: Cheng, Jintao, et autres
Publié: (2026)
par: Cheng, Jintao, et autres
Publié: (2026)
ModaLink: Unifying Modalities for Efficient Image-to-PointCloud Place Recognition
par: Xie, Weidong, et autres
Publié: (2024)
par: Xie, Weidong, et autres
Publié: (2024)
Documents similaires
-
Beyond First-Order: Learning Riemannian Geometries for Invariant Visual Place Recognition
par: Cheng, Jintao, et autres
Publié: (2026) -
OverlapMamba: Novel Shift State Space Model for LiDAR-based Place Recognition
par: Xiang, Qiuchi, et autres
Publié: (2024) -
A Pseudo Global Fusion Paradigm-Based Cross-View Network for LiDAR-Based Place Recognition
par: Cheng, Jintao, et autres
Publié: (2025) -
Diversify, Don't Fine-Tune: Scaling Up Visual Recognition Training with Synthetic Images
par: Yu, Zhuoran, et autres
Publié: (2023) -
Don't Just Fine-tune the Agent, Tune the Environment
par: Lu, Siyuan, et autres
Publié: (2025)