DisTime: Distribution-based Time Representation for Video Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Yingsen, Huang, Zepeng, Zhong, Yujie, Feng, Chengjian, Hu, Jie, Ma, Lin, Liu, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniMD: Towards Unifying Moment Retrieval and Temporal Action Detection
di: Zeng, Yingsen, et al.
Pubblicazione: (2024)
di: Zeng, Yingsen, et al.
Pubblicazione: (2024)
LinVT: Empower Your Image-level Large Language Model to Understand Videos
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
di: Wei, Cong, et al.
Pubblicazione: (2024)
di: Wei, Cong, et al.
Pubblicazione: (2024)
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
di: Feng, Chengjian, et al.
Pubblicazione: (2024)
di: Feng, Chengjian, et al.
Pubblicazione: (2024)
RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
di: Huang, Zhijian, et al.
Pubblicazione: (2024)
di: Huang, Zhijian, et al.
Pubblicazione: (2024)
RoboTron-Sim: Improving Real-World Driving via Simulated Hard-Case
di: Xiao, Baihui, et al.
Pubblicazione: (2025)
di: Xiao, Baihui, et al.
Pubblicazione: (2025)
InstructVEdit: A Holistic Approach for Instructional Video Editing
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
RFSR: Improving ISR Diffusion Models via Reward Feedback Learning
di: Sun, Xiaopeng, et al.
Pubblicazione: (2024)
di: Sun, Xiaopeng, et al.
Pubblicazione: (2024)
RoboUniView: Visual-Language Model with Unified View Representation for Robotic Manipulation
di: Liu, Fanfan, et al.
Pubblicazione: (2024)
di: Liu, Fanfan, et al.
Pubblicazione: (2024)
Matten: Video Generation with Mamba-Attention
di: Gao, Yu, et al.
Pubblicazione: (2024)
di: Gao, Yu, et al.
Pubblicazione: (2024)
HyperSeg: Towards Universal Visual Segmentation with Large Language Model
di: Wei, Cong, et al.
Pubblicazione: (2024)
di: Wei, Cong, et al.
Pubblicazione: (2024)
AP-CAP: Advancing High-Quality Data Synthesis for Animal Pose Estimation via a Controllable Image Generation Pipeline
di: Wang, Lei, et al.
Pubblicazione: (2025)
di: Wang, Lei, et al.
Pubblicazione: (2025)
LaSagnA: Language-based Segmentation Assistant for Complex Queries
di: Wei, Cong, et al.
Pubblicazione: (2024)
di: Wei, Cong, et al.
Pubblicazione: (2024)
UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models
di: Pan, Hewen, et al.
Pubblicazione: (2025)
di: Pan, Hewen, et al.
Pubblicazione: (2025)
Causal Tracing of Object Representations in Large Vision Language Models: Mechanistic Interpretability and Hallucination Mitigation
di: Li, Qiming, et al.
Pubblicazione: (2025)
di: Li, Qiming, et al.
Pubblicazione: (2025)
LeapAlign: Post-Training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories
di: Liang, Zhanhao, et al.
Pubblicazione: (2026)
di: Liang, Zhanhao, et al.
Pubblicazione: (2026)
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
di: Liu, Feng, et al.
Pubblicazione: (2024)
di: Liu, Feng, et al.
Pubblicazione: (2024)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
di: Chen, Shimin, et al.
Pubblicazione: (2024)
di: Chen, Shimin, et al.
Pubblicazione: (2024)
MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection
di: Yang, Shengtian, et al.
Pubblicazione: (2025)
di: Yang, Shengtian, et al.
Pubblicazione: (2025)
DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching
di: Zou, Chang, et al.
Pubblicazione: (2026)
di: Zou, Chang, et al.
Pubblicazione: (2026)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models
di: Zhang, Jianwei, et al.
Pubblicazione: (2026)
di: Zhang, Jianwei, et al.
Pubblicazione: (2026)
KiToke: Kernel-based Interval-aware Token Compression for Video Large Language Models
di: Huang, Haifeng, et al.
Pubblicazione: (2026)
di: Huang, Haifeng, et al.
Pubblicazione: (2026)
MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators
di: Yuan, Shenghai, et al.
Pubblicazione: (2024)
di: Yuan, Shenghai, et al.
Pubblicazione: (2024)
DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models
di: Ma, Jin, et al.
Pubblicazione: (2025)
di: Ma, Jin, et al.
Pubblicazione: (2025)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
di: Wang, Ye, et al.
Pubblicazione: (2025)
di: Wang, Ye, et al.
Pubblicazione: (2025)
ReSeDis: A Dataset for Referring-based Object Search across Large-Scale Image Collections
di: Huang, Ziling, et al.
Pubblicazione: (2025)
di: Huang, Ziling, et al.
Pubblicazione: (2025)
Splatter a Video: Video Gaussian Representation for Versatile Processing
di: Sun, Yang-Tian, et al.
Pubblicazione: (2024)
di: Sun, Yang-Tian, et al.
Pubblicazione: (2024)
MRStyle: A Unified Framework for Color Style Transfer with Multi-Modality Reference
di: Huang, Jiancheng, et al.
Pubblicazione: (2024)
di: Huang, Jiancheng, et al.
Pubblicazione: (2024)
Enhancing Temporal Modeling of Video LLMs via Time Gating
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2024)
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2024)
TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability
di: Chen, Shimin, et al.
Pubblicazione: (2024)
di: Chen, Shimin, et al.
Pubblicazione: (2024)
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
di: Chen, Yuqing, et al.
Pubblicazione: (2025)
di: Chen, Yuqing, et al.
Pubblicazione: (2025)
Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models
di: Jia, Kaidi, et al.
Pubblicazione: (2026)
di: Jia, Kaidi, et al.
Pubblicazione: (2026)
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation
di: You, Ling, et al.
Pubblicazione: (2025)
di: You, Ling, et al.
Pubblicazione: (2025)
Helios: Real Real-Time Long Video Generation Model
di: Yuan, Shenghai, et al.
Pubblicazione: (2026)
di: Yuan, Shenghai, et al.
Pubblicazione: (2026)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
di: Ren, Shuhuai, et al.
Pubblicazione: (2023)
di: Ren, Shuhuai, et al.
Pubblicazione: (2023)
Video Understanding with Large Language Models: A Survey
di: Tang, Yolo Y., et al.
Pubblicazione: (2023)
di: Tang, Yolo Y., et al.
Pubblicazione: (2023)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
di: Lin, Xinying, et al.
Pubblicazione: (2026)
di: Lin, Xinying, et al.
Pubblicazione: (2026)
Documenti analoghi
-
UniMD: Towards Unifying Moment Retrieval and Temporal Action Detection
di: Zeng, Yingsen, et al.
Pubblicazione: (2024) -
LinVT: Empower Your Image-level Large Language Model to Understand Videos
di: Gao, Lishuai, et al.
Pubblicazione: (2024) -
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
di: Wei, Cong, et al.
Pubblicazione: (2024) -
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
di: Feng, Chengjian, et al.
Pubblicazione: (2024) -
RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
di: Huang, Zhijian, et al.
Pubblicazione: (2024)