Structure Over Scale: Learning Visual Reasoning from Pedagogical Video
Fuente:
arXiv
Guardado en:
| Autores principales: | Galoaa, Bishoy, Bai, Xiangyu, Ostadabbas, Sarah |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
por: Bai, Xiangyu, et al.
Publicado: (2026)
por: Bai, Xiangyu, et al.
Publicado: (2026)
Track and Caption Any Motion: Query-Free Motion Discovery and Description in Videos
por: Galoaa, Bishoy, et al.
Publicado: (2025)
por: Galoaa, Bishoy, et al.
Publicado: (2025)
Lang2Motion: Bridging Language and Motion through Joint Embedding Spaces
por: Galoaa, Bishoy, et al.
Publicado: (2025)
por: Galoaa, Bishoy, et al.
Publicado: (2025)
Motion-o: Trajectory-Grounded Video Reasoning
por: Galoaa, Bishoy, et al.
Publicado: (2026)
por: Galoaa, Bishoy, et al.
Publicado: (2026)
K-Track: Kalman-Enhanced Tracking for Accelerating Deep Point Trackers on Edge Devices
por: Galoaa, Bishoy, et al.
Publicado: (2025)
por: Galoaa, Bishoy, et al.
Publicado: (2025)
MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis
por: Bai, Xiangyu, et al.
Publicado: (2025)
por: Bai, Xiangyu, et al.
Publicado: (2025)
UniTrack: Differentiable Graph Representation Learning for Multi-Object Tracking
por: Galoaa, Bishoy, et al.
Publicado: (2026)
por: Galoaa, Bishoy, et al.
Publicado: (2026)
Look Around and Pay Attention: Multi-camera Point Tracking Reimagined with Transformers
por: Galoaa, Bishoy, et al.
Publicado: (2025)
por: Galoaa, Bishoy, et al.
Publicado: (2025)
PanoWorld: Geometry-Consistent Panoramic Video World Modeling
por: Jiang, Le, et al.
Publicado: (2026)
por: Jiang, Le, et al.
Publicado: (2026)
Broadening View Synthesis of Dynamic Scenes from Constrained Monocular Videos
por: Jiang, Le, et al.
Publicado: (2025)
por: Jiang, Le, et al.
Publicado: (2025)
Overcoming Small Data Limitations in Video-Based Infant Respiration Estimation
por: Song, Liyang, et al.
Publicado: (2025)
por: Song, Liyang, et al.
Publicado: (2025)
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
por: Kulkarni, Yogesh, et al.
Publicado: (2025)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
por: Yan, Ziang, et al.
Publicado: (2025)
por: Yan, Ziang, et al.
Publicado: (2025)
SpaceVista: All-Scale Visual Spatial Reasoning from mm to km
por: Sun, Peiwen, et al.
Publicado: (2025)
por: Sun, Peiwen, et al.
Publicado: (2025)
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
por: Wang, Zhaozhi, et al.
Publicado: (2025)
por: Wang, Zhaozhi, et al.
Publicado: (2025)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
por: Li, Lingxiao, et al.
Publicado: (2025)
por: Li, Lingxiao, et al.
Publicado: (2025)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
por: Bai, Tianyi, et al.
Publicado: (2025)
por: Bai, Tianyi, et al.
Publicado: (2025)
Artemis: Structured Visual Reasoning for Perception Policy Learning
por: Tang, Wei, et al.
Publicado: (2025)
por: Tang, Wei, et al.
Publicado: (2025)
SCALAR: Scale-wise Controllable Visual Autoregressive Learning
por: Xu, Ryan, et al.
Publicado: (2025)
por: Xu, Ryan, et al.
Publicado: (2025)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
por: Zhang, Haoji, et al.
Publicado: (2025)
por: Zhang, Haoji, et al.
Publicado: (2025)
Video-R1: Reinforcing Video Reasoning in MLLMs
por: Feng, Kaituo, et al.
Publicado: (2025)
por: Feng, Kaituo, et al.
Publicado: (2025)
Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos
por: Jiang, Songtao, et al.
Publicado: (2026)
por: Jiang, Songtao, et al.
Publicado: (2026)
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
por: Tang, Yolo Y., et al.
Publicado: (2025)
por: Tang, Yolo Y., et al.
Publicado: (2025)
SAVMap: Structure-Aided Visual Mapping of Large-Scale 2.5D Manhattan Wireframes from Panoramic Video
por: Huang, Howard, et al.
Publicado: (2026)
por: Huang, Howard, et al.
Publicado: (2026)
MotiMotion: Motion-Controlled Video Generation with Visual Reasoning
por: Hsin-Ying, Lee, et al.
Publicado: (2026)
por: Hsin-Ying, Lee, et al.
Publicado: (2026)
Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
por: Ouyang, Kun, et al.
Publicado: (2025)
por: Ouyang, Kun, et al.
Publicado: (2025)
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
por: He, Zhihao, et al.
Publicado: (2025)
por: He, Zhihao, et al.
Publicado: (2025)
PANICL: Mitigating Over-Reliance on Single Prompt in Visual In-Context Learning
por: Zhang, Jiahao, et al.
Publicado: (2025)
por: Zhang, Jiahao, et al.
Publicado: (2025)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
por: Bai, Sule, et al.
Publicado: (2025)
por: Bai, Sule, et al.
Publicado: (2025)
Grounded Reinforcement Learning for Visual Reasoning
por: Sarch, Gabriel, et al.
Publicado: (2025)
por: Sarch, Gabriel, et al.
Publicado: (2025)
Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning
por: zhang, Kaixin, et al.
Publicado: (2026)
por: zhang, Kaixin, et al.
Publicado: (2026)
Act2See: Emergent Active Visual Perception for Video Reasoning
por: Ma, Martin Q., et al.
Publicado: (2026)
por: Ma, Martin Q., et al.
Publicado: (2026)
VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues
por: Swetha, Sirnam, et al.
Publicado: (2025)
por: Swetha, Sirnam, et al.
Publicado: (2025)
Can Multimodal LLMs See Science Instruction? Benchmarking Pedagogical Reasoning in K-12 Classroom Videos
por: Shen, Yixuan, et al.
Publicado: (2026)
por: Shen, Yixuan, et al.
Publicado: (2026)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
por: Luo, Ziyang, et al.
Publicado: (2025)
por: Luo, Ziyang, et al.
Publicado: (2025)
Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
por: Chen, Yang, et al.
Publicado: (2025)
por: Chen, Yang, et al.
Publicado: (2025)
Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning
por: Yang, Songyuan, et al.
Publicado: (2026)
por: Yang, Songyuan, et al.
Publicado: (2026)
JVID: Joint Video-Image Diffusion for Visual-Quality and Temporal-Consistency in Video Generation
por: Reynaud, Hadrien, et al.
Publicado: (2024)
por: Reynaud, Hadrien, et al.
Publicado: (2024)
Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models
por: Wang, Anmin, et al.
Publicado: (2026)
por: Wang, Anmin, et al.
Publicado: (2026)
ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering
por: Tran, Duong T., et al.
Publicado: (2025)
por: Tran, Duong T., et al.
Publicado: (2025)
Ejemplares similares
-
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
por: Bai, Xiangyu, et al.
Publicado: (2026) -
Track and Caption Any Motion: Query-Free Motion Discovery and Description in Videos
por: Galoaa, Bishoy, et al.
Publicado: (2025) -
Lang2Motion: Bridging Language and Motion through Joint Embedding Spaces
por: Galoaa, Bishoy, et al.
Publicado: (2025) -
Motion-o: Trajectory-Grounded Video Reasoning
por: Galoaa, Bishoy, et al.
Publicado: (2026) -
K-Track: Kalman-Enhanced Tracking for Accelerating Deep Point Trackers on Edge Devices
por: Galoaa, Bishoy, et al.
Publicado: (2025)