REVEAL -- Reasoning and Evaluation of Visual Evidence through Aligned Language
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Praharaj, Ipsita, Butala, Yukta, Praharaj, Badrikanath, Butala, Yash |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Cross-Corpus and Cross-domain Handwriting Assessment of NeuroDegenerative Diseases via Time-Series-to-Image Conversion
von: Chavez, Gabrielle, et al.
Veröffentlicht: (2025)
von: Chavez, Gabrielle, et al.
Veröffentlicht: (2025)
REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection
von: Zhou, Jun, et al.
Veröffentlicht: (2026)
von: Zhou, Jun, et al.
Veröffentlicht: (2026)
Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models
von: T V, Sethuraman, et al.
Veröffentlicht: (2026)
von: T V, Sethuraman, et al.
Veröffentlicht: (2026)
OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web
von: Kapoor, Raghav, et al.
Veröffentlicht: (2024)
von: Kapoor, Raghav, et al.
Veröffentlicht: (2024)
REVEAL: Reasoning-Enhanced Forensic Evidence Analysis for Explainable AI-Generated Image Detection
von: Cao, Huangsen, et al.
Veröffentlicht: (2025)
von: Cao, Huangsen, et al.
Veröffentlicht: (2025)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
von: Chaybouti, Sofian, et al.
Veröffentlicht: (2025)
von: Chaybouti, Sofian, et al.
Veröffentlicht: (2025)
VER-Bench: Evaluating MLLMs on Reasoning with Fine-Grained Visual Evidence
von: Qiang, Chenhui, et al.
Veröffentlicht: (2025)
von: Qiang, Chenhui, et al.
Veröffentlicht: (2025)
REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction
von: Leem, Seowung, et al.
Veröffentlicht: (2026)
von: Leem, Seowung, et al.
Veröffentlicht: (2026)
SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning
von: Jeon, Byungwoo, et al.
Veröffentlicht: (2026)
von: Jeon, Byungwoo, et al.
Veröffentlicht: (2026)
Improving Visual Reasoning with Iterative Evidence Refinement
von: Shi, Zeru, et al.
Veröffentlicht: (2026)
von: Shi, Zeru, et al.
Veröffentlicht: (2026)
Re-Aligning Language to Visual Objects with an Agentic Workflow
von: Chen, Yuming, et al.
Veröffentlicht: (2025)
von: Chen, Yuming, et al.
Veröffentlicht: (2025)
Pathological Truth Bias in Vision-Language Models
von: Thube, Yash
Veröffentlicht: (2025)
von: Thube, Yash
Veröffentlicht: (2025)
Understanding Depth and Height Perception in Large Visual-Language Models
von: Azad, Shehreen, et al.
Veröffentlicht: (2024)
von: Azad, Shehreen, et al.
Veröffentlicht: (2024)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
von: Wang, Haochen, et al.
Veröffentlicht: (2025)
von: Wang, Haochen, et al.
Veröffentlicht: (2025)
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
von: Wang, Chuhan, et al.
Veröffentlicht: (2026)
von: Wang, Chuhan, et al.
Veröffentlicht: (2026)
MARVEL: Multidimensional Abstraction and Reasoning through Visual Evaluation and Learning
von: Jiang, Yifan, et al.
Veröffentlicht: (2024)
von: Jiang, Yifan, et al.
Veröffentlicht: (2024)
Visual Reasoning through Tool-supervised Reinforcement Learning
von: Dong, Qihua, et al.
Veröffentlicht: (2026)
von: Dong, Qihua, et al.
Veröffentlicht: (2026)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
von: Chen, Bowei, et al.
Veröffentlicht: (2025)
von: Chen, Bowei, et al.
Veröffentlicht: (2025)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
von: Xu, Weiye, et al.
Veröffentlicht: (2025)
von: Xu, Weiye, et al.
Veröffentlicht: (2025)
Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning
von: Gou, Yunhao, et al.
Veröffentlicht: (2025)
von: Gou, Yunhao, et al.
Veröffentlicht: (2025)
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
von: Li, Yan, et al.
Veröffentlicht: (2026)
von: Li, Yan, et al.
Veröffentlicht: (2026)
ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation
von: Huang, Qing, et al.
Veröffentlicht: (2026)
von: Huang, Qing, et al.
Veröffentlicht: (2026)
Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models
von: Khan, Sumra, et al.
Veröffentlicht: (2026)
von: Khan, Sumra, et al.
Veröffentlicht: (2026)
Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning
von: Lee, Naeun, et al.
Veröffentlicht: (2026)
von: Lee, Naeun, et al.
Veröffentlicht: (2026)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
von: Zheng, Yushuo, et al.
Veröffentlicht: (2026)
von: Zheng, Yushuo, et al.
Veröffentlicht: (2026)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
von: Wu, Linquan, et al.
Veröffentlicht: (2026)
von: Wu, Linquan, et al.
Veröffentlicht: (2026)
GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning
von: Miao, Deshui, et al.
Veröffentlicht: (2026)
von: Miao, Deshui, et al.
Veröffentlicht: (2026)
Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images
von: Li, Xuchen, et al.
Veröffentlicht: (2026)
von: Li, Xuchen, et al.
Veröffentlicht: (2026)
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
von: Jiang, Yanbei, et al.
Veröffentlicht: (2025)
von: Jiang, Yanbei, et al.
Veröffentlicht: (2025)
Large Language Models are Universal Reasoners for Visual Generation
von: Ren, Sucheng, et al.
Veröffentlicht: (2026)
von: Ren, Sucheng, et al.
Veröffentlicht: (2026)
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
von: Törtei, Brigitta Malagurski, et al.
Veröffentlicht: (2025)
von: Törtei, Brigitta Malagurski, et al.
Veröffentlicht: (2025)
Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
von: Zafar, Anas, et al.
Veröffentlicht: (2026)
von: Zafar, Anas, et al.
Veröffentlicht: (2026)
SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
von: Yang, Xiao, et al.
Veröffentlicht: (2026)
von: Yang, Xiao, et al.
Veröffentlicht: (2026)
EasyARC: Evaluating Vision Language Models on True Visual Reasoning
von: Unsal, Mert, et al.
Veröffentlicht: (2025)
von: Unsal, Mert, et al.
Veröffentlicht: (2025)
MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning
von: Wang, Jianghui, et al.
Veröffentlicht: (2023)
von: Wang, Jianghui, et al.
Veröffentlicht: (2023)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
von: Li, Bin, et al.
Veröffentlicht: (2025)
von: Li, Bin, et al.
Veröffentlicht: (2025)
Reasoning Visual Language Model for Chest X-Ray Analysis
von: Myronenko, Andriy, et al.
Veröffentlicht: (2025)
von: Myronenko, Andriy, et al.
Veröffentlicht: (2025)
Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
von: Ouyang, Kun, et al.
Veröffentlicht: (2025)
von: Ouyang, Kun, et al.
Veröffentlicht: (2025)
BabyVision: Visual Reasoning Beyond Language
von: Chen, Liang, et al.
Veröffentlicht: (2026)
von: Chen, Liang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Cross-Corpus and Cross-domain Handwriting Assessment of NeuroDegenerative Diseases via Time-Series-to-Image Conversion
von: Chavez, Gabrielle, et al.
Veröffentlicht: (2025) -
REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection
von: Zhou, Jun, et al.
Veröffentlicht: (2026) -
Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models
von: T V, Sethuraman, et al.
Veröffentlicht: (2026) -
OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web
von: Kapoor, Raghav, et al.
Veröffentlicht: (2024) -
REVEAL: Reasoning-Enhanced Forensic Evidence Analysis for Explainable AI-Generated Image Detection
von: Cao, Huangsen, et al.
Veröffentlicht: (2025)