SDRT: Enhance Vision-Language Models by Self-Distillation with Diverse Reasoning Traces
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Guande, Song, Huan, Wang, Yawei, Yan, Qiaojing, Tian, Yijun, Cheong, Lin Lee, Xu, Panpan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reinforcement Learning for Self-Improving Agent with Skill Library
par: Wang, Jiongxiao, et autres
Publié: (2025)
par: Wang, Jiongxiao, et autres
Publié: (2025)
VISD: Enhancing Video Reasoning via Structured Self-Distillation
par: Lin, Hao, et autres
Publié: (2026)
par: Lin, Hao, et autres
Publié: (2026)
Elucidating the Preconditioning in Consistency Distillation
par: Zheng, Kaiwen, et autres
Publié: (2025)
par: Zheng, Kaiwen, et autres
Publié: (2025)
Vision Transformers with Self-Distilled Registers
par: Chen, Yinjie, et autres
Publié: (2025)
par: Chen, Yinjie, et autres
Publié: (2025)
Anatomy-Anchored Self-Supervision: Distilling Vision Foundation Models for Invariant Ultrasound Representation
par: Zhu, Chunzheng, et autres
Publié: (2026)
par: Zhu, Chunzheng, et autres
Publié: (2026)
Distillation Dynamics: Towards Understanding Feature-Based Distillation in Vision Transformers
par: Tian, Huiyuan, et autres
Publié: (2025)
par: Tian, Huiyuan, et autres
Publié: (2025)
Vision-Language Dataset Distillation
par: Wu, Xindi, et autres
Publié: (2023)
par: Wu, Xindi, et autres
Publié: (2023)
Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model
par: Wang, Chenfeng, et autres
Publié: (2026)
par: Wang, Chenfeng, et autres
Publié: (2026)
SALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory Graph
par: Li, Jiazheng, et autres
Publié: (2025)
par: Li, Jiazheng, et autres
Publié: (2025)
Stealthy Backdoor Attack in Self-Supervised Learning Vision Encoders for Large Vision Language Models
par: Liu, Zhaoyi, et autres
Publié: (2025)
par: Liu, Zhaoyi, et autres
Publié: (2025)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
par: Xu, Yige, et autres
Publié: (2026)
par: Xu, Yige, et autres
Publié: (2026)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
par: Hu, Yushi, et autres
Publié: (2023)
par: Hu, Yushi, et autres
Publié: (2023)
Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
par: Li, Jiangyang, et autres
Publié: (2026)
par: Li, Jiangyang, et autres
Publié: (2026)
ViTCN: Vision Transformer Contrastive Network For Reasoning
par: Song, Bo, et autres
Publié: (2024)
par: Song, Bo, et autres
Publié: (2024)
Optimized View and Geometry Distillation from Multi-view Diffuser
par: Zhang, Youjia, et autres
Publié: (2023)
par: Zhang, Youjia, et autres
Publié: (2023)
Enhancing Vision-Language Models Generalization via Diversity-Driven Novel Feature Synthesis
par: Yan, Siyuan, et autres
Publié: (2024)
par: Yan, Siyuan, et autres
Publié: (2024)
Score Distillation of Flow Matching Models
par: Zhou, Mingyuan, et autres
Publié: (2025)
par: Zhou, Mingyuan, et autres
Publié: (2025)
Diverse Score Distillation
par: Xu, Yanbo, et autres
Publié: (2024)
par: Xu, Yanbo, et autres
Publié: (2024)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
par: Guo, Wenxuan, et autres
Publié: (2026)
par: Guo, Wenxuan, et autres
Publié: (2026)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
par: Xu, Guowei, et autres
Publié: (2024)
par: Xu, Guowei, et autres
Publié: (2024)
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
par: Li, Yuqi, et autres
Publié: (2025)
par: Li, Yuqi, et autres
Publié: (2025)
RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics
par: Zhou, Enshen, et autres
Publié: (2025)
par: Zhou, Enshen, et autres
Publié: (2025)
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
par: Bousselham, Walid, et autres
Publié: (2025)
par: Bousselham, Walid, et autres
Publié: (2025)
PartDistill: 3D Shape Part Segmentation by Vision-Language Model Distillation
par: Umam, Ardian, et autres
Publié: (2023)
par: Umam, Ardian, et autres
Publié: (2023)
Physics Context Builders: A Modular Framework for Physical Reasoning in Vision-Language Models
par: Balazadeh, Vahid, et autres
Publié: (2024)
par: Balazadeh, Vahid, et autres
Publié: (2024)
ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
par: Ye, Wencheng, et autres
Publié: (2025)
par: Ye, Wencheng, et autres
Publié: (2025)
Distilling Vision-Language Models on Millions of Videos
par: Zhao, Yue, et autres
Publié: (2024)
par: Zhao, Yue, et autres
Publié: (2024)
Self-Rewarding Vision-Language Model via Reasoning Decomposition
par: Li, Zongxia, et autres
Publié: (2025)
par: Li, Zongxia, et autres
Publié: (2025)
POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Document Conversion
par: Liu, Yuan, et autres
Publié: (2025)
par: Liu, Yuan, et autres
Publié: (2025)
FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models
par: Pyo, Jiyoon, et autres
Publié: (2025)
par: Pyo, Jiyoon, et autres
Publié: (2025)
Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization
par: Li, Jinlong, et autres
Publié: (2024)
par: Li, Jinlong, et autres
Publié: (2024)
Adversarial Prompt Distillation for Vision-Language Models
par: Luo, Lin, et autres
Publié: (2024)
par: Luo, Lin, et autres
Publié: (2024)
VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism
par: Zhang, Congzhi, et autres
Publié: (2025)
par: Zhang, Congzhi, et autres
Publié: (2025)
MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models
par: Rahman, Amirul, et autres
Publié: (2025)
par: Rahman, Amirul, et autres
Publié: (2025)
Visual-Advantage On-Policy Distillation for Vision-Language Models
par: Liu, Ruiqi, et autres
Publié: (2026)
par: Liu, Ruiqi, et autres
Publié: (2026)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
par: Yoon, Hee Suk, et autres
Publié: (2026)
par: Yoon, Hee Suk, et autres
Publié: (2026)
From Per-Image Low-Rank to Encoding Mismatch: Rethinking Feature Distillation in Vision Transformers
par: Tian, Huiyuan, et autres
Publié: (2025)
par: Tian, Huiyuan, et autres
Publié: (2025)
1.x-Distill: Breaking the Diversity, Quality, and Efficiency Barrier in Distribution Matching Distillation
par: Li, Haoyu, et autres
Publié: (2026)
par: Li, Haoyu, et autres
Publié: (2026)
Synthetic Vasculature and Pathology Enhance Vision-Language Model Reasoning
par: Li, Chenjun, et autres
Publié: (2025)
par: Li, Chenjun, et autres
Publié: (2025)
Distillation-Enhanced Physical Adversarial Attacks
par: Liu, Wei, et autres
Publié: (2025)
par: Liu, Wei, et autres
Publié: (2025)
Documents similaires
-
Reinforcement Learning for Self-Improving Agent with Skill Library
par: Wang, Jiongxiao, et autres
Publié: (2025) -
VISD: Enhancing Video Reasoning via Structured Self-Distillation
par: Lin, Hao, et autres
Publié: (2026) -
Elucidating the Preconditioning in Consistency Distillation
par: Zheng, Kaiwen, et autres
Publié: (2025) -
Vision Transformers with Self-Distilled Registers
par: Chen, Yinjie, et autres
Publié: (2025) -
Anatomy-Anchored Self-Supervision: Distilling Vision Foundation Models for Invariant Ultrasound Representation
par: Zhu, Chunzheng, et autres
Publié: (2026)