ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Jiaxin, Kang, Zhaolu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
di: Qian, Long, et al.
Pubblicazione: (2024)
di: Qian, Long, et al.
Pubblicazione: (2024)
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
di: Xiong, Yuqi, et al.
Pubblicazione: (2026)
di: Xiong, Yuqi, et al.
Pubblicazione: (2026)
InterAct-Video: Reasoning-Rich Video QA for Urban Traffic
di: Vishal, Joseph Raj, et al.
Pubblicazione: (2025)
di: Vishal, Joseph Raj, et al.
Pubblicazione: (2025)
Act2See: Emergent Active Visual Perception for Video Reasoning
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning
di: Chen, Li-Heng, et al.
Pubblicazione: (2026)
di: Chen, Li-Heng, et al.
Pubblicazione: (2026)
FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
di: Zhang, Lu, et al.
Pubblicazione: (2025)
di: Zhang, Lu, et al.
Pubblicazione: (2025)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
di: Shen, Yifan, et al.
Pubblicazione: (2025)
di: Shen, Yifan, et al.
Pubblicazione: (2025)
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios
di: Zhu, Lu, et al.
Pubblicazione: (2025)
di: Zhu, Lu, et al.
Pubblicazione: (2025)
Fine-Grained Representation for Lane Topology Reasoning
di: Xu, Guoqing, et al.
Pubblicazione: (2025)
di: Xu, Guoqing, et al.
Pubblicazione: (2025)
VER-Bench: Evaluating MLLMs on Reasoning with Fine-Grained Visual Evidence
di: Qiang, Chenhui, et al.
Pubblicazione: (2025)
di: Qiang, Chenhui, et al.
Pubblicazione: (2025)
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
di: Sun, Lang, et al.
Pubblicazione: (2026)
di: Sun, Lang, et al.
Pubblicazione: (2026)
OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs
di: Chen, Feng, et al.
Pubblicazione: (2025)
di: Chen, Feng, et al.
Pubblicazione: (2025)
FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions
di: Zhao, Peisen, et al.
Pubblicazione: (2026)
di: Zhao, Peisen, et al.
Pubblicazione: (2026)
Dual-Pathway Circuits of Object Hallucination in Vision-Language Models
di: Liu, Jiaxin, et al.
Pubblicazione: (2026)
di: Liu, Jiaxin, et al.
Pubblicazione: (2026)
Temporal In-Context Fine-Tuning with Temporal Reasoning for Versatile Control of Video Diffusion Models
di: Kim, Kinam, et al.
Pubblicazione: (2025)
di: Kim, Kinam, et al.
Pubblicazione: (2025)
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
di: Li, Zijian, et al.
Pubblicazione: (2025)
di: Li, Zijian, et al.
Pubblicazione: (2025)
AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning
di: Galougah, Siminfar Samakoush, et al.
Pubblicazione: (2025)
di: Galougah, Siminfar Samakoush, et al.
Pubblicazione: (2025)
Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging
di: Fu, Zihang, et al.
Pubblicazione: (2026)
di: Fu, Zihang, et al.
Pubblicazione: (2026)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
di: Wang, Qi, et al.
Pubblicazione: (2025)
di: Wang, Qi, et al.
Pubblicazione: (2025)
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
di: Sayem, MD Khalequzzaman Chowdhury, et al.
Pubblicazione: (2026)
di: Sayem, MD Khalequzzaman Chowdhury, et al.
Pubblicazione: (2026)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
di: Ling, Yiran, et al.
Pubblicazione: (2026)
di: Ling, Yiran, et al.
Pubblicazione: (2026)
Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation
di: Liu, Yaohua, et al.
Pubblicazione: (2025)
di: Liu, Yaohua, et al.
Pubblicazione: (2025)
VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
di: Liu, Yuanxin, et al.
Pubblicazione: (2025)
Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding
di: Wu, Zhixuan, et al.
Pubblicazione: (2026)
di: Wu, Zhixuan, et al.
Pubblicazione: (2026)
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
di: Li, Yan, et al.
Pubblicazione: (2026)
di: Li, Yan, et al.
Pubblicazione: (2026)
Part-Aware Bottom-Up Group Reasoning for Fine-Grained Social Interaction Detection
di: Kim, Dongkeun, et al.
Pubblicazione: (2025)
di: Kim, Dongkeun, et al.
Pubblicazione: (2025)
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
di: Han, Songhao, et al.
Pubblicazione: (2024)
di: Han, Songhao, et al.
Pubblicazione: (2024)
V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models
di: Luo, Yang, et al.
Pubblicazione: (2025)
di: Luo, Yang, et al.
Pubblicazione: (2025)
Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory
di: Zhu, Zhengtong, et al.
Pubblicazione: (2026)
di: Zhu, Zhengtong, et al.
Pubblicazione: (2026)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
di: Jin, Jing, et al.
Pubblicazione: (2026)
di: Jin, Jing, et al.
Pubblicazione: (2026)
ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning
di: Wang, Yeyuan, et al.
Pubblicazione: (2025)
di: Wang, Yeyuan, et al.
Pubblicazione: (2025)
VISA: Reasoning Video Object Segmentation via Large Language Models
di: Yan, Cilin, et al.
Pubblicazione: (2024)
di: Yan, Cilin, et al.
Pubblicazione: (2024)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
di: Li, Hongxing, et al.
Pubblicazione: (2025)
di: Li, Hongxing, et al.
Pubblicazione: (2025)
Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
Prompt-Guided Spatial Understanding with RGB-D Transformers for Fine-Grained Object Relation Reasoning
di: Muturi, Tanner, et al.
Pubblicazione: (2025)
di: Muturi, Tanner, et al.
Pubblicazione: (2025)
AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning
di: Xue, Junxiao, et al.
Pubblicazione: (2026)
di: Xue, Junxiao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
di: Qian, Long, et al.
Pubblicazione: (2024) -
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
di: Xiong, Yuqi, et al.
Pubblicazione: (2026) -
InterAct-Video: Reasoning-Rich Video QA for Urban Traffic
di: Vishal, Joseph Raj, et al.
Pubblicazione: (2025) -
Act2See: Emergent Active Visual Perception for Video Reasoning
di: Ma, Martin Q., et al.
Pubblicazione: (2026) -
VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning
di: Chen, Li-Heng, et al.
Pubblicazione: (2026)