Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ouyang, Kun, Liu, Yuanxin, Yao, Linli, Cai, Yishuo, Zhou, Hao, Zhou, Jie, Meng, Fandong, Sun, Xu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
von: Ouyang, Kun, et al.
Veröffentlicht: (2025)
von: Ouyang, Kun, et al.
Veröffentlicht: (2025)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
von: Ouyang, Kun, et al.
Veröffentlicht: (2024)
von: Ouyang, Kun, et al.
Veröffentlicht: (2024)
RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction
von: Wang, Yuchi, et al.
Veröffentlicht: (2025)
von: Wang, Yuchi, et al.
Veröffentlicht: (2025)
Figure It Out: Improve the Frontier of Reasoning with Executable Visual States
von: Chen, Meiqi, et al.
Veröffentlicht: (2025)
von: Chen, Meiqi, et al.
Veröffentlicht: (2025)
DeepTrans: Deep Reasoning Translation via Reinforcement Learning
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
ExTrans: Multilingual Deep Reasoning Translation via Exemplar-Enhanced Reinforcement Learning
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
von: Wei, Yuancheng, et al.
Veröffentlicht: (2026)
von: Wei, Yuancheng, et al.
Veröffentlicht: (2026)
Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters
von: Xu, Zhiyu, et al.
Veröffentlicht: (2026)
von: Xu, Zhiyu, et al.
Veröffentlicht: (2026)
Continuous Visual Autoregressive Generation via Score Maximization
von: Shao, Chenze, et al.
Veröffentlicht: (2025)
von: Shao, Chenze, et al.
Veröffentlicht: (2025)
EAG: Extract and Generate Multi-way Aligned Corpus for Complete Multi-lingual Neural Machine Translation
von: Xu, Yulin, et al.
Veröffentlicht: (2022)
von: Xu, Yulin, et al.
Veröffentlicht: (2022)
DRT: Deep Reasoning Translation via Long Chain-of-Thought
von: Wang, Jiaan, et al.
Veröffentlicht: (2024)
von: Wang, Jiaan, et al.
Veröffentlicht: (2024)
Towards Codable Watermarking for Injecting Multi-bits Information to LLMs
von: Wang, Lean, et al.
Veröffentlicht: (2023)
von: Wang, Lean, et al.
Veröffentlicht: (2023)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
von: Yao, Linli, et al.
Veröffentlicht: (2026)
von: Yao, Linli, et al.
Veröffentlicht: (2026)
TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
von: Yang, Zhen, et al.
Veröffentlicht: (2023)
von: Yang, Zhen, et al.
Veröffentlicht: (2023)
CSCD-NS: a Chinese Spelling Check Dataset for Native Speakers
von: Hu, Yong, et al.
Veröffentlicht: (2022)
von: Hu, Yong, et al.
Veröffentlicht: (2022)
Accelerating Inference in Large Language Models with a Unified Layer Skipping Strategy
von: Liu, Yijin, et al.
Veröffentlicht: (2024)
von: Liu, Yijin, et al.
Veröffentlicht: (2024)
THOR-MoE: Hierarchical Task-Guided and Context-Responsive Routing for Neural Machine Translation
von: Liang, Yunlong, et al.
Veröffentlicht: (2025)
von: Liang, Yunlong, et al.
Veröffentlicht: (2025)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
Efficient Covariance Estimation for Sparsified Functional Data
von: Zheng, Sijie, et al.
Veröffentlicht: (2025)
von: Zheng, Sijie, et al.
Veröffentlicht: (2025)
Readability-Robust Code Summarization via Meta Curriculum Learning
von: Zeng, Wenhao, et al.
Veröffentlicht: (2026)
von: Zeng, Wenhao, et al.
Veröffentlicht: (2026)
Outdated Issue Aware Decoding for Reasoning Questions on Edited Knowledge
von: Sun, Zengkui, et al.
Veröffentlicht: (2024)
von: Sun, Zengkui, et al.
Veröffentlicht: (2024)
Temporal Reasoning Transfer from Text to Video
von: Li, Lei, et al.
Veröffentlicht: (2024)
von: Li, Lei, et al.
Veröffentlicht: (2024)
Large Language Models Are Not Robust Multiple Choice Selectors
von: Zheng, Chujie, et al.
Veröffentlicht: (2023)
von: Zheng, Chujie, et al.
Veröffentlicht: (2023)
MiniPLM: Knowledge Distillation for Pre-Training Language Models
von: Gu, Yuxian, et al.
Veröffentlicht: (2024)
von: Gu, Yuxian, et al.
Veröffentlicht: (2024)
UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings
von: Lan, Zhibin, et al.
Veröffentlicht: (2025)
von: Lan, Zhibin, et al.
Veröffentlicht: (2025)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
von: Liu, Juntao, et al.
Veröffentlicht: (2025)
von: Liu, Juntao, et al.
Veröffentlicht: (2025)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
von: Zhang, Xue, et al.
Veröffentlicht: (2025)
von: Zhang, Xue, et al.
Veröffentlicht: (2025)
A Law Reasoning Benchmark for LLM with Tree-Organized Structures including Factum Probandum, Evidence and Experiences
von: Shen, Jiaxin, et al.
Veröffentlicht: (2025)
von: Shen, Jiaxin, et al.
Veröffentlicht: (2025)
VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
von: Liu, Yuanxin, et al.
Veröffentlicht: (2025)
von: Liu, Yuanxin, et al.
Veröffentlicht: (2025)
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
von: Sun, Xiaokun, et al.
Veröffentlicht: (2026)
von: Sun, Xiaokun, et al.
Veröffentlicht: (2026)
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
von: Yao, Linli, et al.
Veröffentlicht: (2025)
von: Yao, Linli, et al.
Veröffentlicht: (2025)
CRAT: A Multi-Agent Framework for Causality-Enhanced Reflective and Retrieval-Augmented Translation with Large Language Models
von: Chen, Meiqi, et al.
Veröffentlicht: (2024)
von: Chen, Meiqi, et al.
Veröffentlicht: (2024)
TIM: Teaching Large Language Models to Translate with Comparison
von: Zeng, Jiali, et al.
Veröffentlicht: (2023)
von: Zeng, Jiali, et al.
Veröffentlicht: (2023)
Retrieval-Augmented Machine Translation with Unstructured Knowledge
von: Wang, Jiaan, et al.
Veröffentlicht: (2024)
von: Wang, Jiaan, et al.
Veröffentlicht: (2024)
Improving Machine Translation with Large Language Models: A Preliminary Study with Cooperative Decoding
von: Zeng, Jiali, et al.
Veröffentlicht: (2023)
von: Zeng, Jiali, et al.
Veröffentlicht: (2023)
Language Generation with Strictly Proper Scoring Rules
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
Understanding and Addressing the Under-Translation Problem from the Perspective of Decoding Objective
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
SlangDIT: Benchmarking LLMs in Interpretative Slang Translation
von: Liang, Yunlong, et al.
Veröffentlicht: (2025)
von: Liang, Yunlong, et al.
Veröffentlicht: (2025)
Continuous Autoregressive Language Models
von: Shao, Chenze, et al.
Veröffentlicht: (2025)
von: Shao, Chenze, et al.
Veröffentlicht: (2025)
ArrowGEV: Grounding Events in Video via Learning the Arrow of Time
von: Yu, Fangxu, et al.
Veröffentlicht: (2026)
von: Yu, Fangxu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
von: Ouyang, Kun, et al.
Veröffentlicht: (2025) -
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
von: Ouyang, Kun, et al.
Veröffentlicht: (2024) -
RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction
von: Wang, Yuchi, et al.
Veröffentlicht: (2025) -
Figure It Out: Improve the Frontier of Reasoning with Executable Visual States
von: Chen, Meiqi, et al.
Veröffentlicht: (2025) -
DeepTrans: Deep Reasoning Translation via Reinforcement Learning
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)