Apollo: An Exploration of Video Understanding in Large Multimodal Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zohar, Orr, Wang, Xiaohan, Dubois, Yann, Mehta, Nikhil, Xiao, Tong, Hansen-Estruch, Philippe, Yu, Licheng, Wang, Xiaofang, Juefei-Xu, Felix, Zhang, Ning, Yeung-Levy, Serena, Xia, Xide |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
por: Wang, Xiaohan, et al.
Publicado: (2024)
por: Wang, Xiaohan, et al.
Publicado: (2024)
Temporal Preference Optimization for Long-Form Video Understanding
por: Li, Rui, et al.
Publicado: (2025)
por: Li, Rui, et al.
Publicado: (2025)
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
por: Zohar, Orr, et al.
Publicado: (2024)
por: Zohar, Orr, et al.
Publicado: (2024)
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
por: Chen, Liangyu, et al.
Publicado: (2025)
por: Chen, Liangyu, et al.
Publicado: (2025)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
por: Zhao, Shiyu, et al.
Publicado: (2024)
por: Zhao, Shiyu, et al.
Publicado: (2024)
Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language Models
por: Sui, Elaine, et al.
Publicado: (2024)
por: Sui, Elaine, et al.
Publicado: (2024)
Zero-shot Action Localization via the Confidence of Large Vision-Language Models
por: Aklilu, Josiah, et al.
Publicado: (2024)
por: Aklilu, Josiah, et al.
Publicado: (2024)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
por: Endo, Mark, et al.
Publicado: (2024)
por: Endo, Mark, et al.
Publicado: (2024)
ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters
por: Hansen-Estruch, Philippe, et al.
Publicado: (2026)
por: Hansen-Estruch, Philippe, et al.
Publicado: (2026)
Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models
por: Endo, Mark, et al.
Publicado: (2025)
por: Endo, Mark, et al.
Publicado: (2025)
Continuous Perception Matters: Diagnosing Temporal Integration Failures in Multimodal Models
por: Wang, Zeyu, et al.
Publicado: (2024)
por: Wang, Zeyu, et al.
Publicado: (2024)
Foundation Models Secretly Understand Neural Network Weights: Enhancing Hypernetwork Architectures with Foundation Models
por: Gu, Jeffrey, et al.
Publicado: (2025)
por: Gu, Jeffrey, et al.
Publicado: (2025)
Fine-tuning MLLMs Without Forgetting Is Easier Than You Think
por: Li, He, et al.
Publicado: (2026)
por: Li, He, et al.
Publicado: (2026)
Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning
por: Wu, Shengguang, et al.
Publicado: (2025)
por: Wu, Shengguang, et al.
Publicado: (2025)
Learnings from Scaling Visual Tokenizers for Reconstruction and Generation
por: Hansen-Estruch, Philippe, et al.
Publicado: (2025)
por: Hansen-Estruch, Philippe, et al.
Publicado: (2025)
AccidentBench: Benchmarking Multimodal Understanding and Reasoning in Vehicle Accidents and Beyond
por: Gu, Shangding, et al.
Publicado: (2025)
por: Gu, Shangding, et al.
Publicado: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
por: Deng, Andong, et al.
Publicado: (2025)
por: Deng, Andong, et al.
Publicado: (2025)
Multi-Human Mesh Recovery with Transformers
por: Wang, Zeyu, et al.
Publicado: (2024)
por: Wang, Zeyu, et al.
Publicado: (2024)
NegVQA: Can Vision Language Models Understand Negation?
por: Zhang, Yuhui, et al.
Publicado: (2025)
por: Zhang, Yuhui, et al.
Publicado: (2025)
V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think
por: Tang, Bingda, et al.
Publicado: (2026)
por: Tang, Bingda, et al.
Publicado: (2026)
Closing the Modality Gap for Mixed Modality Search
por: Li, Binxu, et al.
Publicado: (2025)
por: Li, Binxu, et al.
Publicado: (2025)
Viewpoint Textual Inversion: Discovering Scene Representations and 3D View Control in 2D Diffusion Models
por: Burgess, James, et al.
Publicado: (2023)
por: Burgess, James, et al.
Publicado: (2023)
UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
por: Chen, Leon Liangyu, et al.
Publicado: (2026)
por: Chen, Leon Liangyu, et al.
Publicado: (2026)
Unified Auto-Encoding with Masked Diffusion
por: Hansen-Estruch, Philippe, et al.
Publicado: (2024)
por: Hansen-Estruch, Philippe, et al.
Publicado: (2024)
Why are Visually-Grounded Language Models Bad at Image Classification?
por: Zhang, Yuhui, et al.
Publicado: (2024)
por: Zhang, Yuhui, et al.
Publicado: (2024)
Tool Verification for Test-Time Reinforcement Learning
por: Liao, Ruotong, et al.
Publicado: (2026)
por: Liao, Ruotong, et al.
Publicado: (2026)
DeforHMR: Vision Transformer with Deformable Cross-Attention for 3D Human Mesh Recovery
por: Heo, Jaewoo, et al.
Publicado: (2024)
por: Heo, Jaewoo, et al.
Publicado: (2024)
Frontières et mobilité au quotidien
por: Dubois, Yann
Publicado: (2020)
por: Dubois, Yann
Publicado: (2020)
Parental mental health and migraine in youth: An evolving story historically plagued with sparse and inadequate literature and mother‐blaming
por: Serena L. Orr
Publicado: (2024)
por: Serena L. Orr
Publicado: (2024)
Retrofitted adult interventions aren't good enough: Why children and adolescents deserve tailored evidence‐based care for migraine in the emergency department
por: Serena L. Orr
Publicado: (2026)
por: Serena L. Orr
Publicado: (2026)
Connect, Collapse, Corrupt: Learning Cross-Modal Tasks with Uni-Modal Data
por: Zhang, Yuhui, et al.
Publicado: (2024)
por: Zhang, Yuhui, et al.
Publicado: (2024)
Motion Diffusion-Guided 3D Global HMR from a Dynamic Camera
por: Heo, Jaewoo, et al.
Publicado: (2024)
por: Heo, Jaewoo, et al.
Publicado: (2024)
Statue of Apollo Kitharodos (Apollo Citharoedus), the Lyre-Player
por: Scan-the-World
Publicado: (2026)
por: Scan-the-World
Publicado: (2026)
Diffusion-HPC: Synthetic Data Generation for Human Mesh Recovery in Challenging Domains
por: Weng, Zhenzhen, et al.
Publicado: (2023)
por: Weng, Zhenzhen, et al.
Publicado: (2023)
RadDiff: Describing Differences in Radiology Image Sets with Natural Language
por: Shen, Xiaoxian, et al.
Publicado: (2026)
por: Shen, Xiaoxian, et al.
Publicado: (2026)
Video Action Differencing
por: Burgess, James, et al.
Publicado: (2025)
por: Burgess, James, et al.
Publicado: (2025)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
por: Hou, Wenjin, et al.
Publicado: (2026)
por: Hou, Wenjin, et al.
Publicado: (2026)
Unleashing In-context Learning of Autoregressive Models for Few-shot Image Manipulation
por: Lai, Bolin, et al.
Publicado: (2024)
por: Lai, Bolin, et al.
Publicado: (2024)
Apollo Medicine
Publicado: (2021)
Publicado: (2021)
David - Apollo
por: Scan-the-World
Publicado: (2026)
por: Scan-the-World
Publicado: (2026)
Ejemplares similares
-
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
por: Wang, Xiaohan, et al.
Publicado: (2024) -
Temporal Preference Optimization for Long-Form Video Understanding
por: Li, Rui, et al.
Publicado: (2025) -
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
por: Zohar, Orr, et al.
Publicado: (2024) -
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
por: Chen, Liangyu, et al.
Publicado: (2025) -
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
por: Zhao, Shiyu, et al.
Publicado: (2024)