DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Chao, Zhang, Zeliang, Liu, Jiang, Sun, Ximeng, Wu, Jialian, Yu, Xiaodong, Wang, Ze, Xu, Chenliang, Barsoum, Emad, Liu, Zicheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Latent Visual Reasoning
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
por: Guo, Yuxiang, et al.
Publicado: (2025)
por: Guo, Yuxiang, et al.
Publicado: (2025)
TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Games
por: Mishra, Prakamya, et al.
Publicado: (2025)
por: Mishra, Prakamya, et al.
Publicado: (2025)
XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
por: Lin, Jingyang, et al.
Publicado: (2026)
por: Lin, Jingyang, et al.
Publicado: (2026)
Learning from Online Videos at Inference Time for Computer-Use Agents
por: Liu, Yujian, et al.
Publicado: (2025)
por: Liu, Yujian, et al.
Publicado: (2025)
Agent Laboratory: Using LLM Agents as Research Assistants
por: Schmidgall, Samuel, et al.
Publicado: (2025)
por: Schmidgall, Samuel, et al.
Publicado: (2025)
Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation
por: Wang, Ze, et al.
Publicado: (2025)
por: Wang, Ze, et al.
Publicado: (2025)
Self-Taught Agentic Long Context Understanding
por: Zhuang, Yufan, et al.
Publicado: (2025)
por: Zhuang, Yufan, et al.
Publicado: (2025)
KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
Stabilizing Efficient Reasoning with Step-Level Advantage Selection
por: Wang, Han, et al.
Publicado: (2026)
por: Wang, Han, et al.
Publicado: (2026)
CD4LM: Consistency Distillation and aDaptive Decoding for Diffusion Language Models
por: Liang, Yihao, et al.
Publicado: (2026)
por: Liang, Yihao, et al.
Publicado: (2026)
MOVi: Training-free Text-conditioned Multi-Object Video Generation
por: Rahman, Aimon, et al.
Publicado: (2025)
por: Rahman, Aimon, et al.
Publicado: (2025)
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
por: Lin, Jingyang, et al.
Publicado: (2025)
por: Lin, Jingyang, et al.
Publicado: (2025)
Reliable Use of Lemmas via Eligibility Reasoning and Section$-$Aware Reinforcement Learning
por: Xu, Zhikun, et al.
Publicado: (2026)
por: Xu, Zhikun, et al.
Publicado: (2026)
Instella: Fully Open Language Models with Stellar Performance
por: Liu, Jiang, et al.
Publicado: (2025)
por: Liu, Jiang, et al.
Publicado: (2025)
SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
Training Large Reasoning Models Efficiently via Progressive Thought Encoding
por: Zhang, Zeliang, et al.
Publicado: (2026)
por: Zhang, Zeliang, et al.
Publicado: (2026)
CaptionQA: Is Your Caption as Useful as the Image Itself?
por: Yang, Shijia, et al.
Publicado: (2025)
por: Yang, Shijia, et al.
Publicado: (2025)
TermiGen: High-Fidelity Environment and Robust Trajectory Synthesis for Terminal Agents
por: Zhu, Kaijie, et al.
Publicado: (2026)
por: Zhu, Kaijie, et al.
Publicado: (2026)
APRIL: Active Partial Rollouts in Reinforcement Learning to Tame Long-tail Generation
por: Zhou, Yuzhen, et al.
Publicado: (2025)
por: Zhou, Yuzhen, et al.
Publicado: (2025)
AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection
por: Ray, Pretam, et al.
Publicado: (2026)
por: Ray, Pretam, et al.
Publicado: (2026)
TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering
por: Joshi, Vinay, et al.
Publicado: (2025)
por: Joshi, Vinay, et al.
Publicado: (2025)
Harnessing the Computation Redundancy in ViTs to Boost Adversarial Transferability
por: Liu, Jiani, et al.
Publicado: (2025)
por: Liu, Jiani, et al.
Publicado: (2025)
Learning to Transform Dynamically for Better Adversarial Transferability
por: Zhu, Rongyi, et al.
Publicado: (2024)
por: Zhu, Rongyi, et al.
Publicado: (2024)
Diversifying the Expert Knowledge for Task-Agnostic Pruning in Sparse Mixture-of-Experts
por: Zhang, Zeliang, et al.
Publicado: (2024)
por: Zhang, Zeliang, et al.
Publicado: (2024)
DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference
por: Singh, Aditya Kumar, et al.
Publicado: (2026)
por: Singh, Aditya Kumar, et al.
Publicado: (2026)
Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion
por: Singh, Shivam, et al.
Publicado: (2026)
por: Singh, Shivam, et al.
Publicado: (2026)
Why Instruction-Based Unlearning Fails in Diffusion Models?
por: Zhang, Zeliang, et al.
Publicado: (2026)
por: Zhang, Zeliang, et al.
Publicado: (2026)
Geo-Expert: Towards Expert-Level Geological Reasoning via Parameter-Efficient Fine-Tuning
por: Guo, Chenyou, et al.
Publicado: (2026)
por: Guo, Chenyou, et al.
Publicado: (2026)
PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning
por: Dong, Daize, et al.
Publicado: (2026)
por: Dong, Daize, et al.
Publicado: (2026)
OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering
por: Vosoughi, Ali, et al.
Publicado: (2025)
por: Vosoughi, Ali, et al.
Publicado: (2025)
SAND-Math: Using LLMs to Generate Novel, Difficult and Useful Mathematics Questions and Answers
por: Manem, Chaitanya, et al.
Publicado: (2025)
por: Manem, Chaitanya, et al.
Publicado: (2025)
Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP
por: Zhang, Zeliang, et al.
Publicado: (2024)
por: Zhang, Zeliang, et al.
Publicado: (2024)
Taming Diffusion Prior for Image Super-Resolution with Domain Shift SDEs
por: Cui, Qinpeng, et al.
Publicado: (2024)
por: Cui, Qinpeng, et al.
Publicado: (2024)
Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See
por: Zhang, Zeliang, et al.
Publicado: (2024)
por: Zhang, Zeliang, et al.
Publicado: (2024)
Efficiently Leveraging Linguistic Priors for Scene Text Spotting
por: Nguyen, Nguyen, et al.
Publicado: (2024)
por: Nguyen, Nguyen, et al.
Publicado: (2024)
Approximated Likelihood Ratio: A Forward-Only and Parallel Framework for Boosting Neural Network Training
por: Zhang, Zeliang, et al.
Publicado: (2024)
por: Zhang, Zeliang, et al.
Publicado: (2024)
Fine‐Tuning Electron Transfer for Nanozyme Design
por: Xia Zong, et al.
Publicado: (2024)
por: Xia Zong, et al.
Publicado: (2024)
Forward Learning with Differential Privacy
por: Feng, Mingqian, et al.
Publicado: (2025)
por: Feng, Mingqian, et al.
Publicado: (2025)
Ejemplares similares
-
Latent Visual Reasoning
por: Li, Bangzheng, et al.
Publicado: (2025) -
ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
por: Guo, Yuxiang, et al.
Publicado: (2025) -
TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Games
por: Mishra, Prakamya, et al.
Publicado: (2025) -
XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models
por: Wang, Xingrui, et al.
Publicado: (2025) -
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
por: Lin, Jingyang, et al.
Publicado: (2026)