DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Chiu, Bo-Cheng, Chen, Jen-Jee, Tseng, Yu-Chee, Chen, Feng-Chi, Yen, An-Zi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Displacement-Aware WiFi Representations for Weakly Supervised Relative Localization
di: Wei, Tzu-Ti, et al.
Pubblicazione: (2026)
di: Wei, Tzu-Ti, et al.
Pubblicazione: (2026)
Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference
di: Chen, Bo-Wei, et al.
Pubblicazione: (2026)
di: Chen, Bo-Wei, et al.
Pubblicazione: (2026)
WiFi2Cap: Semantic Action Captioning from Wi-Fi CSI via Limb-Level Semantic Alignment
di: Wei, Tzu-Ti, et al.
Pubblicazione: (2026)
di: Wei, Tzu-Ti, et al.
Pubblicazione: (2026)
Refining Financial Consumer Complaints through Multi-Scale Model Interaction
di: Chen, Bo-Wei, et al.
Pubblicazione: (2025)
di: Chen, Bo-Wei, et al.
Pubblicazione: (2025)
ReXTime: A Benchmark Suite for Reasoning-Across-Time in Videos
di: Chen, Jr-Jen, et al.
Pubblicazione: (2024)
di: Chen, Jr-Jen, et al.
Pubblicazione: (2024)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos
di: Fateh, Fawad Javed, et al.
Pubblicazione: (2024)
di: Fateh, Fawad Javed, et al.
Pubblicazione: (2024)
Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters
di: Chiu, Pin-Yen, et al.
Pubblicazione: (2025)
di: Chiu, Pin-Yen, et al.
Pubblicazione: (2025)
Invisible Backdoor Triggers in Image Editing Model via Deep Watermarking
di: Chen, Yu-Feng, et al.
Pubblicazione: (2025)
di: Chen, Yu-Feng, et al.
Pubblicazione: (2025)
LingBench++: A Linguistically-Informed Benchmark and Reasoning Framework for Multi-Step and Cross-Cultural Inference with LLMs
di: Lian, Da-Chen, et al.
Pubblicazione: (2025)
di: Lian, Da-Chen, et al.
Pubblicazione: (2025)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
Can Multimodal LLMs See Science Instruction? Benchmarking Pedagogical Reasoning in K-12 Classroom Videos
di: Shen, Yixuan, et al.
Pubblicazione: (2026)
di: Shen, Yixuan, et al.
Pubblicazione: (2026)
ISSR: Iterative Selection with Self-Review for Vocabulary Test Distractor Generation
di: Liu, Yu-Cheng, et al.
Pubblicazione: (2025)
di: Liu, Yu-Cheng, et al.
Pubblicazione: (2025)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
di: Guo, Yifu, et al.
Pubblicazione: (2025)
di: Guo, Yifu, et al.
Pubblicazione: (2025)
Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
Learning-Based WiFi Fingerprint Inpainting via Generative Adversarial Networks
di: Chan, Yu, et al.
Pubblicazione: (2024)
di: Chan, Yu, et al.
Pubblicazione: (2024)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
di: Liang, Yiming, et al.
Pubblicazione: (2026)
di: Liang, Yiming, et al.
Pubblicazione: (2026)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios
di: Zhu, Lu, et al.
Pubblicazione: (2025)
di: Zhu, Lu, et al.
Pubblicazione: (2025)
How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms
di: Jin, Shengji, et al.
Pubblicazione: (2026)
di: Jin, Shengji, et al.
Pubblicazione: (2026)
Paraphrase-Aligned Machine Translation
di: Chang, Ke-Ching, et al.
Pubblicazione: (2024)
di: Chang, Ke-Ching, et al.
Pubblicazione: (2024)
Language Matters: How Do Multilingual Input and Reasoning Paths Affect Large Reasoning Models?
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025)
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025)
Enhancing Temporal Modeling of Video LLMs via Time Gating
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2024)
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2024)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
VISTA: A Generative Egocentric Video Framework for Daily Assistance
di: Liu, Yu-Hsiang, et al.
Pubblicazione: (2026)
di: Liu, Yu-Hsiang, et al.
Pubblicazione: (2026)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
di: Song, Mingyang, et al.
Pubblicazione: (2026)
di: Song, Mingyang, et al.
Pubblicazione: (2026)
Quantum-Enhanced Temporal Embeddings via a Hybrid Seq2Seq Architecture
di: Hsieh, Tien-Ching, et al.
Pubblicazione: (2026)
di: Hsieh, Tien-Ching, et al.
Pubblicazione: (2026)
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
di: Yu, Shoubin, et al.
Pubblicazione: (2024)
di: Yu, Shoubin, et al.
Pubblicazione: (2024)
SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding
di: Sheng, Zihao, et al.
Pubblicazione: (2025)
di: Sheng, Zihao, et al.
Pubblicazione: (2025)
GaMO: Geometry-aware Multi-view Diffusion Outpainting for Sparse-View 3D Reconstruction
di: Huang, Yi-Chuan, et al.
Pubblicazione: (2025)
di: Huang, Yi-Chuan, et al.
Pubblicazione: (2025)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
di: Ma, David, et al.
Pubblicazione: (2025)
di: Ma, David, et al.
Pubblicazione: (2025)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
di: Jiang, Ruixiang, et al.
Pubblicazione: (2025)
di: Jiang, Ruixiang, et al.
Pubblicazione: (2025)
Stay Hungry, Stay Foolish: On the Extended Reading Articles Generation with LLMs
di: Liou, Yow-Fu, et al.
Pubblicazione: (2025)
di: Liou, Yow-Fu, et al.
Pubblicazione: (2025)
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
IntenBot: Flexible and Imprecise Multimodal Input for LLMs to Understand User Intentions for Casual and Human-Like HRI
di: Liu, Yen-Ting, et al.
Pubblicazione: (2026)
di: Liu, Yen-Ting, et al.
Pubblicazione: (2026)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Learning Displacement-Aware WiFi Representations for Weakly Supervised Relative Localization
di: Wei, Tzu-Ti, et al.
Pubblicazione: (2026) -
Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference
di: Chen, Bo-Wei, et al.
Pubblicazione: (2026) -
WiFi2Cap: Semantic Action Captioning from Wi-Fi CSI via Limb-Level Semantic Alignment
di: Wei, Tzu-Ti, et al.
Pubblicazione: (2026) -
Refining Financial Consumer Complaints through Multi-Scale Model Interaction
di: Chen, Bo-Wei, et al.
Pubblicazione: (2025) -
ReXTime: A Benchmark Suite for Reasoning-Across-Time in Videos
di: Chen, Jr-Jen, et al.
Pubblicazione: (2024)