Enregistré dans:
| Auteurs principaux: | Wu, Yike, Wang, Yiwei, Cai, Yujun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.06292 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
par: Ge, Haonan, et autres
Publié: (2025)
par: Ge, Haonan, et autres
Publié: (2025)
MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
par: Ge, Haonan, et autres
Publié: (2025)
par: Ge, Haonan, et autres
Publié: (2025)
Cure or Poison? Embedding Instructions Visually Alters Hallucination in Vision-Language Models
par: Wang, Zhaochen, et autres
Publié: (2025)
par: Wang, Zhaochen, et autres
Publié: (2025)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
par: Liu, Xu, et autres
Publié: (2026)
par: Liu, Xu, et autres
Publié: (2026)
When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models
par: Yakun, Cui, et autres
Publié: (2026)
par: Yakun, Cui, et autres
Publié: (2026)
Interleaved-Modal Chain-of-Thought
par: Gao, Jun, et autres
Publié: (2024)
par: Gao, Jun, et autres
Publié: (2024)
CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning
par: Wu, Hang, et autres
Publié: (2026)
par: Wu, Hang, et autres
Publié: (2026)
Interleaving Reasoning for Better Text-to-Image Generation
par: Huang, Wenxuan, et autres
Publié: (2025)
par: Huang, Wenxuan, et autres
Publié: (2025)
Mitigating Coordinate Prediction Bias from Positional Encoding Failures
par: Tao, Xingjian, et autres
Publié: (2025)
par: Tao, Xingjian, et autres
Publié: (2025)
Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models
par: Wang, Zhaochen, et autres
Publié: (2025)
par: Wang, Zhaochen, et autres
Publié: (2025)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
par: Zhang, Yongheng, et autres
Publié: (2025)
par: Zhang, Yongheng, et autres
Publié: (2025)
Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios
par: Corbière, Charles, et autres
Publié: (2025)
par: Corbière, Charles, et autres
Publié: (2025)
Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
par: Chen, Chao, et autres
Publié: (2025)
par: Chen, Chao, et autres
Publié: (2025)
PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs
par: Sun, Bowen, et autres
Publié: (2025)
par: Sun, Bowen, et autres
Publié: (2025)
Holistic Evaluation for Interleaved Text-and-Image Generation
par: Liu, Minqian, et autres
Publié: (2024)
par: Liu, Minqian, et autres
Publié: (2024)
Improving Chain-of-Thought Efficiency for Autoregressive Image Generation
par: Gu, Zeqi, et autres
Publié: (2025)
par: Gu, Zeqi, et autres
Publié: (2025)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
par: Wu, Hang, et autres
Publié: (2026)
par: Wu, Hang, et autres
Publié: (2026)
Text-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMs
par: Lin, Chenchen, et autres
Publié: (2026)
par: Lin, Chenchen, et autres
Publié: (2026)
ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
par: Tao, Xingjian, et autres
Publié: (2026)
par: Tao, Xingjian, et autres
Publié: (2026)
COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts
par: Wang, Bingli, et autres
Publié: (2026)
par: Wang, Bingli, et autres
Publié: (2026)
Mitigating Hallucinations in Multimodal Spatial Relations through Constraint-Aware Prompting
par: Wu, Jiarui, et autres
Publié: (2025)
par: Wu, Jiarui, et autres
Publié: (2025)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
par: Wu, Hang, et autres
Publié: (2025)
par: Wu, Hang, et autres
Publié: (2025)
OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text
par: Li, Qingyun, et autres
Publié: (2024)
par: Li, Qingyun, et autres
Publié: (2024)
From Easy to Hard: The MIR Benchmark for Progressive Interleaved Multi-Image Reasoning
par: Du, Hang, et autres
Publié: (2025)
par: Du, Hang, et autres
Publié: (2025)
OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
par: Zhang, Zhenguo, et autres
Publié: (2025)
par: Zhang, Zhenguo, et autres
Publié: (2025)
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
par: Fu, Honghao, et autres
Publié: (2026)
par: Fu, Honghao, et autres
Publié: (2026)
A High-Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation
par: Feng, Yukang, et autres
Publié: (2025)
par: Feng, Yukang, et autres
Publié: (2025)
GeoChain: Multimodal Chain-of-Thought for Geographic Reasoning
par: Yerramilli, Sahiti, et autres
Publié: (2025)
par: Yerramilli, Sahiti, et autres
Publié: (2025)
Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning
par: Deng, Linger, et autres
Publié: (2024)
par: Deng, Linger, et autres
Publié: (2024)
CoV: Chain-of-View Prompting for Spatial Reasoning
par: Zhao, Haoyu, et autres
Publié: (2026)
par: Zhao, Haoyu, et autres
Publié: (2026)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
par: Lu, Yi, et autres
Publié: (2025)
par: Lu, Yi, et autres
Publié: (2025)
Mitigating Hallucinations on Object Attributes using Multiview Images and Negative Instructions
par: Tan, Zhijie, et autres
Publié: (2025)
par: Tan, Zhijie, et autres
Publié: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing
par: Zou, Zhentao, et autres
Publié: (2025)
par: Zou, Zhentao, et autres
Publié: (2025)
Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads
par: Kou, Siqi, et autres
Publié: (2024)
par: Kou, Siqi, et autres
Publié: (2024)
Simple o3: Towards Interleaved Vision-Language Reasoning
par: Wang, Ye, et autres
Publié: (2025)
par: Wang, Ye, et autres
Publié: (2025)
Hierarchical, Interpretable, Label-Free Concept Bottleneck Model
par: Xie, Haodong, et autres
Publié: (2026)
par: Xie, Haodong, et autres
Publié: (2026)
Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
par: Du, Yifan, et autres
Publié: (2025)
par: Du, Yifan, et autres
Publié: (2025)
Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering
par: Lim, Youngsun, et autres
Publié: (2024)
par: Lim, Youngsun, et autres
Publié: (2024)
VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models
par: Zhang, Zefan, et autres
Publié: (2026)
par: Zhang, Zefan, et autres
Publié: (2026)
Documents similaires
-
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
par: Ge, Haonan, et autres
Publié: (2025) -
MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
par: Ge, Haonan, et autres
Publié: (2025) -
Cure or Poison? Embedding Instructions Visually Alters Hallucination in Vision-Language Models
par: Wang, Zhaochen, et autres
Publié: (2025) -
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
par: Liu, Xu, et autres
Publié: (2026) -
When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models
par: Yakun, Cui, et autres
Publié: (2026)