CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Chaoyu, Barua, Deeparghya Dutta, Tao, Fei, Fazli, Pooyan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding
di: Li, Chaoyu, et al.
Pubblicazione: (2024)
di: Li, Chaoyu, et al.
Pubblicazione: (2024)
ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
di: Li, Chaoyu, et al.
Pubblicazione: (2025)
di: Li, Chaoyu, et al.
Pubblicazione: (2025)
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
ChartQA-X: Generating Explanations for Visual Chart Reasoning
di: Hegde, Shamanthak, et al.
Pubblicazione: (2025)
di: Hegde, Shamanthak, et al.
Pubblicazione: (2025)
VideoA11y: Method and Dataset for Accessible Video Description
di: Li, Chaoyu, et al.
Pubblicazione: (2025)
di: Li, Chaoyu, et al.
Pubblicazione: (2025)
VideoSAVi: Self-Aligned Video Language Models without Human Supervision
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2024)
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2024)
VideoPASTA: 7K Preference Pairs That Matter for Video-LLM Alignment
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025)
FrameOracle: Learning What to See and How Much to See in Videos
di: Li, Chaoyu, et al.
Pubblicazione: (2025)
di: Li, Chaoyu, et al.
Pubblicazione: (2025)
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
di: Zeng, Ziyun, et al.
Pubblicazione: (2025)
di: Zeng, Ziyun, et al.
Pubblicazione: (2025)
ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla
di: Barua, Deeparghya Dutta, et al.
Pubblicazione: (2024)
di: Barua, Deeparghya Dutta, et al.
Pubblicazione: (2024)
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
di: Li, Pengxiang, et al.
Pubblicazione: (2025)
di: Li, Pengxiang, et al.
Pubblicazione: (2025)
Training-Free Multimodal Deepfake Detection via Graph Reasoning
di: Liu, Yuxin, et al.
Pubblicazione: (2025)
di: Liu, Yuxin, et al.
Pubblicazione: (2025)
Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation
di: Luo, Jingnan, et al.
Pubblicazione: (2026)
di: Luo, Jingnan, et al.
Pubblicazione: (2026)
Align and Aggregate: Compositional Reasoning with Video Alignment and Answer Aggregation for Video Question-Answering
di: Liao, Zhaohe, et al.
Pubblicazione: (2024)
di: Liao, Zhaohe, et al.
Pubblicazione: (2024)
OSCaR: Object State Captioning and State Change Representation
di: Nguyen, Nguyen, et al.
Pubblicazione: (2024)
di: Nguyen, Nguyen, et al.
Pubblicazione: (2024)
See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
di: Zhang, Yongchang, et al.
Pubblicazione: (2026)
di: Zhang, Yongchang, et al.
Pubblicazione: (2026)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
di: Yan, Ziang, et al.
Pubblicazione: (2025)
di: Yan, Ziang, et al.
Pubblicazione: (2025)
An Empirical Study of Accuracy-Robustness Tradeoff and Training Efficiency in Self-Supervised Learning
di: Ghofrani, Fatemeh, et al.
Pubblicazione: (2025)
di: Ghofrani, Fatemeh, et al.
Pubblicazione: (2025)
Cast and Attached Shadow Detection via Iterative Light and Geometry Reasoning
di: Hu, Shilin, et al.
Pubblicazione: (2025)
di: Hu, Shilin, et al.
Pubblicazione: (2025)
CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance
di: Mondal, Anindya, et al.
Pubblicazione: (2025)
di: Mondal, Anindya, et al.
Pubblicazione: (2025)
Post-interactive Multimodal Trajectory Prediction for Autonomous Driving
di: Huang, Ziyi, et al.
Pubblicazione: (2025)
di: Huang, Ziyi, et al.
Pubblicazione: (2025)
Joint Segmentation and Grading with Iterative Optimization for Multimodal Glaucoma Diagnosis
di: Wang, Zhiwei, et al.
Pubblicazione: (2026)
di: Wang, Zhiwei, et al.
Pubblicazione: (2026)
Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization
di: Fang, Hao, et al.
Pubblicazione: (2026)
di: Fang, Hao, et al.
Pubblicazione: (2026)
MuSLR: Multimodal Symbolic Logical Reasoning
di: Xu, Jundong, et al.
Pubblicazione: (2025)
di: Xu, Jundong, et al.
Pubblicazione: (2025)
Zero-Shot Character Identification and Speaker Prediction in Comics via Iterative Multimodal Fusion
di: Li, Yingxuan, et al.
Pubblicazione: (2024)
di: Li, Yingxuan, et al.
Pubblicazione: (2024)
Ensembling Diffusion Models via Adaptive Feature Aggregation
di: Wang, Cong, et al.
Pubblicazione: (2024)
di: Wang, Cong, et al.
Pubblicazione: (2024)
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
di: Chng, Yong Xien, et al.
Pubblicazione: (2025)
di: Chng, Yong Xien, et al.
Pubblicazione: (2025)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
di: Wang, Yaoting, et al.
Pubblicazione: (2025)
di: Wang, Yaoting, et al.
Pubblicazione: (2025)
EditThinker: Unlocking Iterative Reasoning for Any Image Editor
di: Li, Hongyu, et al.
Pubblicazione: (2025)
di: Li, Hongyu, et al.
Pubblicazione: (2025)
Improving Visual Reasoning with Iterative Evidence Refinement
di: Shi, Zeru, et al.
Pubblicazione: (2026)
di: Shi, Zeru, et al.
Pubblicazione: (2026)
DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection
di: Zhou, Weilin, et al.
Pubblicazione: (2026)
di: Zhou, Weilin, et al.
Pubblicazione: (2026)
SSCR: Iterative Language-Based Image Editing via Self-Supervised Counterfactual Reasoning
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2020)
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2020)
AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models
di: Wang, Teng, et al.
Pubblicazione: (2026)
di: Wang, Teng, et al.
Pubblicazione: (2026)
MMhops-R1: Multimodal Multi-hop Reasoning
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
AD-FM: Multimodal LLMs for Anomaly Detection via Multi-Stage Reasoning and Fine-Grained Reward Optimization
di: Liao, Jingyi, et al.
Pubblicazione: (2025)
di: Liao, Jingyi, et al.
Pubblicazione: (2025)
Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning
di: Luo, Meng, et al.
Pubblicazione: (2026)
di: Luo, Meng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding
di: Li, Chaoyu, et al.
Pubblicazione: (2024) -
ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
di: Li, Chaoyu, et al.
Pubblicazione: (2025) -
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025) -
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video
di: Kulkarni, Yogesh, et al.
Pubblicazione: (2025) -
ChartQA-X: Generating Explanations for Visual Chart Reasoning
di: Hegde, Shamanthak, et al.
Pubblicazione: (2025)