Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Linghao, Li, Jungang, Hei, Yonghua, Tao, Sicheng, Dai, Song, Yan, Yibo, Dongfang, Zihao, Liu, Weiting, Qin, Chenxi, Li, Hanqian, Zou, Xin, Zhang, Jiahao, Xun, Shuhang, Jiang, Haiyun, Hu, Xuming |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
by: Xun, Shuhang, et al.
Published: (2025)
by: Xun, Shuhang, et al.
Published: (2025)
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
by: Dai, Song, et al.
Published: (2025)
by: Dai, Song, et al.
Published: (2025)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
by: Tao, Sicheng, et al.
Published: (2025)
by: Tao, Sicheng, et al.
Published: (2025)
AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents
by: Shi, Yibo, et al.
Published: (2026)
by: Shi, Yibo, et al.
Published: (2026)
Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities
by: Zhang, Junyan, et al.
Published: (2025)
by: Zhang, Junyan, et al.
Published: (2025)
Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMs
by: Gao, Yubo, et al.
Published: (2026)
by: Gao, Yubo, et al.
Published: (2026)
Unlocking Speech Instruction Data Potential with Query Rewriting
by: Hei, Yonghua, et al.
Published: (2025)
by: Hei, Yonghua, et al.
Published: (2025)
A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model
by: Zheng, Qi, et al.
Published: (2026)
by: Zheng, Qi, et al.
Published: (2026)
SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context
by: Li, Jungang, et al.
Published: (2024)
by: Li, Jungang, et al.
Published: (2024)
VideoMark: A Distortion-Free Robust Watermarking Framework for Video Diffusion Models
by: Hu, Xuming, et al.
Published: (2025)
by: Hu, Xuming, et al.
Published: (2025)
KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues
by: Chen, Junhao, et al.
Published: (2025)
by: Chen, Junhao, et al.
Published: (2025)
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
by: Li, Daiqiang, et al.
Published: (2026)
by: Li, Daiqiang, et al.
Published: (2026)
Video Signature: Implicit Watermarking for Video Diffusion Models
by: Huang, Yu, et al.
Published: (2025)
by: Huang, Yu, et al.
Published: (2025)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
by: Huang, Junquan, et al.
Published: (2025)
by: Huang, Junquan, et al.
Published: (2025)
Optimal Trudinger-Moser inequalities on complete noncompact Riemannian manifolds: Revisit of the argument from the local inequalities to global ones
by: Li, Jungang, et al.
Published: (2026)
by: Li, Jungang, et al.
Published: (2026)
HyperG: Hypergraph-Enhanced LLMs for Structured Knowledge
by: Huang, Sirui, et al.
Published: (2025)
by: Huang, Sirui, et al.
Published: (2025)
SA‐Cost: Structure‐Aware Cost Model With Attention for Tensor Program Tuning
by: Junguo Liao, et al.
Published: (2026)
by: Junguo Liao, et al.
Published: (2026)
Meet Dynamic Individual Preferences: Resolving Conflicting Human Value with Paired Fine-Tuning
by: Wang, Shanyong, et al.
Published: (2026)
by: Wang, Shanyong, et al.
Published: (2026)
Gradient Surgery for Safe LLM Fine-Tuning
by: Yi, Biao, et al.
Published: (2025)
by: Yi, Biao, et al.
Published: (2025)
Unveiling Language Routing Isolation in Multilingual MoE Models for Interpretable Subnetwork Adaptation
by: Zheng, Kening, et al.
Published: (2026)
by: Zheng, Kening, et al.
Published: (2026)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
by: Dongfang, Zihao, et al.
Published: (2025)
by: Dongfang, Zihao, et al.
Published: (2025)
Time Cell Inspired Temporal Codebook in Spiking Neural Networks for Enhanced Image Generation
by: Feng, Linghao, et al.
Published: (2024)
by: Feng, Linghao, et al.
Published: (2024)
Heterogeneous Federated Fine-Tuning with Parallel One-Rank Adaptation
by: Zhang, Zikai, et al.
Published: (2026)
by: Zhang, Zikai, et al.
Published: (2026)
In Situ Amplified Mutational mRNA Imaging Using a Spatially Confined CRISPR Nanoplatform
by: Wen Zhao, et al.
Published: (2026)
by: Wen Zhao, et al.
Published: (2026)
In Situ Amplified Mutational mRNA Imaging Using a Spatially Confined CRISPR Nanoplatform
by: Wen Zhao, et al.
Published: (2026)
by: Wen Zhao, et al.
Published: (2026)
MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language Model
by: Huo, Jiahao, et al.
Published: (2024)
by: Huo, Jiahao, et al.
Published: (2024)
Nurture-First Agent Development: Building Domain-Expert AI Agents Through Conversational Knowledge Crystallization
by: Zhang, Linghao
Published: (2026)
by: Zhang, Linghao
Published: (2026)
Improving Value-based Process Verifier via Low-Cost Variance Reduction
by: Sun, Zetian, et al.
Published: (2025)
by: Sun, Zetian, et al.
Published: (2025)
EgoIntent: An Egocentric Step-level Benchmark for Understanding What, Why, and Next
by: Pan, Ye, et al.
Published: (2026)
by: Pan, Ye, et al.
Published: (2026)
MuxTune: Efficient Multi-Task LLM Fine-Tuning in Multi-Tenant Datacenters via Spatial-Temporal Backbone Multiplexing
by: Xue, Chunyu, et al.
Published: (2026)
by: Xue, Chunyu, et al.
Published: (2026)
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
by: Xu, Kaixuan, et al.
Published: (2025)
by: Xu, Kaixuan, et al.
Published: (2025)
Revisiting Zeroth-Order Optimization for Memory-Efficient LLM Fine-Tuning: A Benchmark
by: Zhang, Yihua, et al.
Published: (2024)
by: Zhang, Yihua, et al.
Published: (2024)
CoheMark: A Novel Sentence-Level Watermark for Enhanced Text Quality
by: Zhang, Junyan, et al.
Published: (2025)
by: Zhang, Junyan, et al.
Published: (2025)
Biologically Inspired Spiking Diffusion Model with Adaptive Lateral Selection Mechanism
by: Feng, Linghao, et al.
Published: (2025)
by: Feng, Linghao, et al.
Published: (2025)
From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
by: Wu, Haodong, et al.
Published: (2026)
by: Wu, Haodong, et al.
Published: (2026)
Pear: Pruning and Sharing Adapters in Visual Parameter-Efficient Fine-Tuning
by: Zhong, Yibo, et al.
Published: (2024)
by: Zhong, Yibo, et al.
Published: (2024)
Small Clips, Big Gains: Learning Long-Range Refocused Temporal Information for Video Super-Resolution
by: Zhou, Xingyu, et al.
Published: (2025)
by: Zhou, Xingyu, et al.
Published: (2025)
VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding
by: He, Jianxiang, et al.
Published: (2025)
by: He, Jianxiang, et al.
Published: (2025)
ST-ReP: Learning Predictive Representations Efficiently for Spatial-Temporal Forecasting
by: Zheng, Qi, et al.
Published: (2024)
by: Zheng, Qi, et al.
Published: (2024)
The Illusion of Role Separation: Hidden Shortcuts in LLM Role Learning (and How to Fix Them)
by: Wang, Zihao, et al.
Published: (2025)
by: Wang, Zihao, et al.
Published: (2025)
Similar Items
-
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
by: Xun, Shuhang, et al.
Published: (2025) -
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
by: Dai, Song, et al.
Published: (2025) -
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
by: Tao, Sicheng, et al.
Published: (2025) -
AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents
by: Shi, Yibo, et al.
Published: (2026) -
Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities
by: Zhang, Junyan, et al.
Published: (2025)