GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training
Fuente:
arXiv
Saved in:
| Main Authors: | Wei, Tong, Yang, Yijun, Zhang, Changhao, Xing, Junliang, Shi, Yuanchun, Lu, Zongqing, Ye, Deheng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training
by: Wei, Tong, et al.
Published: (2025)
by: Wei, Tong, et al.
Published: (2025)
DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs
by: Wei, Yanbin, et al.
Published: (2026)
by: Wei, Yanbin, et al.
Published: (2026)
EMR-Merging: Tuning-Free High-Performance Model Merging
by: Huang, Chenyu, et al.
Published: (2024)
by: Huang, Chenyu, et al.
Published: (2024)
Training-Free Pretrained Model Merging
by: Xu, Zhengqi, et al.
Published: (2024)
by: Xu, Zhengqi, et al.
Published: (2024)
Exploring Reliable PPG Authentication on Smartwatches in Daily Scenarios
by: Tang, Jiankai, et al.
Published: (2025)
by: Tang, Jiankai, et al.
Published: (2025)
AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents
by: Wang, Pan, et al.
Published: (2026)
by: Wang, Pan, et al.
Published: (2026)
FreeOcc: Training-Free Embodied Open-Vocabulary Occupancy Prediction
by: Jiang, Zeyu, et al.
Published: (2026)
by: Jiang, Zeyu, et al.
Published: (2026)
Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework
by: Jia, Hongrui, et al.
Published: (2025)
by: Jia, Hongrui, et al.
Published: (2025)
GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models
by: Xie, Qinghongbing, et al.
Published: (2025)
by: Xie, Qinghongbing, et al.
Published: (2025)
DVI: Disentangling Semantic and Visual Identity for Training-Free Personalized Generation
by: Li, Guandong, et al.
Published: (2025)
by: Li, Guandong, et al.
Published: (2025)
TurboReg: TurboClique for Robust and Efficient Point Cloud Registration
by: Yan, Shaocheng, et al.
Published: (2025)
by: Yan, Shaocheng, et al.
Published: (2025)
Small-Large Collaboration: Training-efficient Concept Personalization for Large VLM using a Meta Personalized Small VLM
by: Yang, Sihan, et al.
Published: (2025)
by: Yang, Sihan, et al.
Published: (2025)
LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
by: Hu, Lianyu, et al.
Published: (2025)
by: Hu, Lianyu, et al.
Published: (2025)
Training-Free Model Merging for Multi-target Domain Adaptation
by: Li, Wenyi, et al.
Published: (2024)
by: Li, Wenyi, et al.
Published: (2024)
Visual Grounding for Object-Level Generalization in Reinforcement Learning
by: Jiang, Haobin, et al.
Published: (2024)
by: Jiang, Haobin, et al.
Published: (2024)
VeloEdit: Training-Free Consistent and Continuous Instruction-Based Image Editing via Velocity Field Decomposition
by: Li, Zongqing, et al.
Published: (2026)
by: Li, Zongqing, et al.
Published: (2026)
MedSAMix: A Training-Free Model Merging Approach for Medical Image Segmentation
by: Yang, Yanwu, et al.
Published: (2025)
by: Yang, Yanwu, et al.
Published: (2025)
FlexID: Training-Free Flexible Identity Injection via Intent-Aware Modulation for Text-to-Image Generation
by: Li, Guandong, et al.
Published: (2026)
by: Li, Guandong, et al.
Published: (2026)
GTR: Gaussian Splatting Tracking and Reconstruction of Unknown Objects Based on Appearance and Geometric Complexity
by: Ikeda, Takuya, et al.
Published: (2025)
by: Ikeda, Takuya, et al.
Published: (2025)
Token Merging for Training-Free Semantic Binding in Text-to-Image Synthesis
by: Hu, Taihang, et al.
Published: (2024)
by: Hu, Taihang, et al.
Published: (2024)
Enhancing Video Transformers for Action Understanding with VLM-aided Training
by: Lu, Hui, et al.
Published: (2024)
by: Lu, Hui, et al.
Published: (2024)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
by: Li, Geng, et al.
Published: (2026)
by: Li, Geng, et al.
Published: (2026)
SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes
by: Maillard, Léopold, et al.
Published: (2026)
by: Maillard, Léopold, et al.
Published: (2026)
OccGaussian: 3D Gaussian Splatting for Occluded Human Rendering
by: Ye, Jingrui, et al.
Published: (2024)
by: Ye, Jingrui, et al.
Published: (2024)
NANO3D: A Training-Free Approach for Efficient 3D Editing Without Masks
by: Ye, Junliang, et al.
Published: (2025)
by: Ye, Junliang, et al.
Published: (2025)
FlowTurbo: Towards Real-time Flow-Based Image Generation with Velocity Refiner
by: Zhao, Wenliang, et al.
Published: (2024)
by: Zhao, Wenliang, et al.
Published: (2024)
GTR: Improving Large 3D Reconstruction Models through Geometry and Texture Refinement
by: Zhuang, Peiye, et al.
Published: (2024)
by: Zhuang, Peiye, et al.
Published: (2024)
EchoPilot: Training-Free Ultrasound Video Segmentation via Scale-Space Semantic Prompting and Reliability-Gated Memory
by: Xiao, Ruiqiang, et al.
Published: (2026)
by: Xiao, Ruiqiang, et al.
Published: (2026)
ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding
by: Shi, Liang, et al.
Published: (2024)
by: Shi, Liang, et al.
Published: (2024)
Turbo-GS: Accelerating 3D Gaussian Fitting for High-Quality Radiance Fields
by: Dhiman, Ankit, et al.
Published: (2024)
by: Dhiman, Ankit, et al.
Published: (2024)
Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning
by: Luo, Liqin, et al.
Published: (2025)
by: Luo, Liqin, et al.
Published: (2025)
SegMamba: Long-range Sequential Modeling Mamba For 3D Medical Image Segmentation
by: Xing, Zhaohu, et al.
Published: (2024)
by: Xing, Zhaohu, et al.
Published: (2024)
Pre-trained Visual Dynamics Representations for Efficient Policy Learning
by: Luo, Hao, et al.
Published: (2024)
by: Luo, Hao, et al.
Published: (2024)
Generalized Gaussian Entropy Model for Point Cloud Attribute Compression with Dynamic Likelihood Intervals
by: Peng, Changhao, et al.
Published: (2025)
by: Peng, Changhao, et al.
Published: (2025)
FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion
by: Lu, Yu, et al.
Published: (2025)
by: Lu, Yu, et al.
Published: (2025)
Training-Free Acceleration of ViTs with Delayed Spatial Merging
by: Heo, Jung Hwan, et al.
Published: (2023)
by: Heo, Jung Hwan, et al.
Published: (2023)
Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks
by: Wang, Yufei, et al.
Published: (2026)
by: Wang, Yufei, et al.
Published: (2026)
VideoMerge: Towards Training-free Long Video Generation
by: Zhang, Siyang, et al.
Published: (2025)
by: Zhang, Siyang, et al.
Published: (2025)
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
by: Huang, Mingzhe, et al.
Published: (2026)
by: Huang, Mingzhe, et al.
Published: (2026)
MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation
by: Zhou, Bohan, et al.
Published: (2025)
by: Zhou, Bohan, et al.
Published: (2025)
Similar Items
-
GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training
by: Wei, Tong, et al.
Published: (2025) -
DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs
by: Wei, Yanbin, et al.
Published: (2026) -
EMR-Merging: Tuning-Free High-Performance Model Merging
by: Huang, Chenyu, et al.
Published: (2024) -
Training-Free Pretrained Model Merging
by: Xu, Zhengqi, et al.
Published: (2024) -
Exploring Reliable PPG Authentication on Smartwatches in Daily Scenarios
by: Tang, Jiankai, et al.
Published: (2025)