MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Han, Wan, David, Lee, Hyunji, Pham, Thinh, Cankosyan, Mikaela, Chen, Weiyuan, Stengel-Eskin, Elias, Vu, Tu, Bansal, Mohit |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multimodal Fact-Level Attribution for Verifiable Reasoning
por: Wan, David, et al.
Publicado: (2026)
por: Wan, David, et al.
Publicado: (2026)
Retrieval-Augmented Generation with Conflicting Evidence
por: Wang, Han, et al.
Publicado: (2025)
por: Wang, Han, et al.
Publicado: (2025)
CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval
por: Wan, David, et al.
Publicado: (2025)
por: Wan, David, et al.
Publicado: (2025)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
por: Prasad, Archiki, et al.
Publicado: (2023)
por: Prasad, Archiki, et al.
Publicado: (2023)
Generalized Correctness Models: Learning Calibrated and Model-Agnostic Correctness Predictors from Historical Patterns
por: Xiao, Hanqi, et al.
Publicado: (2025)
por: Xiao, Hanqi, et al.
Publicado: (2025)
RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
por: Niu, Tianyi, et al.
Publicado: (2025)
por: Niu, Tianyi, et al.
Publicado: (2025)
CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
por: Pothiraj, Atin, et al.
Publicado: (2025)
por: Pothiraj, Atin, et al.
Publicado: (2025)
Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training
por: Wan, David, et al.
Publicado: (2024)
por: Wan, David, et al.
Publicado: (2024)
LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models
por: Stengel-Eskin, Elias, et al.
Publicado: (2024)
por: Stengel-Eskin, Elias, et al.
Publicado: (2024)
Teaching Models to Balance Resisting and Accepting Persuasion
por: Stengel-Eskin, Elias, et al.
Publicado: (2024)
por: Stengel-Eskin, Elias, et al.
Publicado: (2024)
Language Models Identify Ambiguities and Exploit Loopholes
por: Choi, Jio, et al.
Publicado: (2025)
por: Choi, Jio, et al.
Publicado: (2025)
DataEnvGym: Data Generation Agents in Teacher Environments with Student Feedback
por: Khan, Zaid, et al.
Publicado: (2024)
por: Khan, Zaid, et al.
Publicado: (2024)
UPCORE: Utility-Preserving Coreset Selection for Balanced Unlearning
por: Patil, Vaidehi, et al.
Publicado: (2025)
por: Patil, Vaidehi, et al.
Publicado: (2025)
The Sum Leaks More Than Its Parts: Compositional Privacy Risks and Mitigations in Multi-Agent Collaboration
por: Patil, Vaidehi, et al.
Publicado: (2025)
por: Patil, Vaidehi, et al.
Publicado: (2025)
AdaCAD: Adaptively Decoding to Balance Conflicts between Contextual and Parametric Knowledge
por: Wang, Han, et al.
Publicado: (2024)
por: Wang, Han, et al.
Publicado: (2024)
Balancing Faithfulness and Performance in Reasoning via Multi-Listener Soft Execution
por: Sivakumaran, Nithin, et al.
Publicado: (2026)
por: Sivakumaran, Nithin, et al.
Publicado: (2026)
ReGAL: Refactoring Programs to Discover Generalizable Abstractions
por: Stengel-Eskin, Elias, et al.
Publicado: (2024)
por: Stengel-Eskin, Elias, et al.
Publicado: (2024)
Conflict-Resolving and Sharpness-Aware Minimization for Generalized Knowledge Editing with Multiple Updates
por: Nguyen, Duy, et al.
Publicado: (2026)
por: Nguyen, Duy, et al.
Publicado: (2026)
Soft Self-Consistency Improves Language Model Agents
por: Wang, Han, et al.
Publicado: (2024)
por: Wang, Han, et al.
Publicado: (2024)
Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind
por: Xiao, Hanqi, et al.
Publicado: (2026)
por: Xiao, Hanqi, et al.
Publicado: (2026)
GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs
por: Nguyen, Duy, et al.
Publicado: (2025)
por: Nguyen, Duy, et al.
Publicado: (2025)
DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
por: Sivakumaran, Nithin, et al.
Publicado: (2025)
por: Sivakumaran, Nithin, et al.
Publicado: (2025)
MAGDi: Structured Distillation of Multi-Agent Interaction Graphs Improves Reasoning in Smaller Language Models
por: Chen, Justin Chih-Yao, et al.
Publicado: (2024)
por: Chen, Justin Chih-Yao, et al.
Publicado: (2024)
LASeR: Learning to Adaptively Select Reward Models with Multi-Armed Bandits
por: Nguyen, Duy, et al.
Publicado: (2024)
por: Nguyen, Duy, et al.
Publicado: (2024)
Are language models rational? The case of coherence norms and belief revision
por: Hofweber, Thomas, et al.
Publicado: (2024)
por: Hofweber, Thomas, et al.
Publicado: (2024)
GenerationPrograms: Fine-grained Attribution with Executable Programs
por: Wan, David, et al.
Publicado: (2025)
por: Wan, David, et al.
Publicado: (2025)
MAMM-Refine: A Recipe for Improving Faithfulness in Generation with Multi-Agent Collaboration
por: Wan, David, et al.
Publicado: (2025)
por: Wan, David, et al.
Publicado: (2025)
One Life to Learn: Inferring Symbolic World Models for Stochastic Environments from Unguided Exploration
por: Khan, Zaid, et al.
Publicado: (2025)
por: Khan, Zaid, et al.
Publicado: (2025)
See It from My Perspective: How Language Affects Cultural Bias in Image Understanding
por: Ananthram, Amith, et al.
Publicado: (2024)
por: Ananthram, Amith, et al.
Publicado: (2024)
Multi-Attribute Steering of Language Models via Targeted Intervention
por: Nguyen, Duy, et al.
Publicado: (2025)
por: Nguyen, Duy, et al.
Publicado: (2025)
MAgICoRe: Multi-Agent, Iterative, Coarse-to-Fine Refinement for Reasoning
por: Chen, Justin Chih-Yao, et al.
Publicado: (2024)
por: Chen, Justin Chih-Yao, et al.
Publicado: (2024)
LAQuer: Localized Attribution Queries in Content-grounded Generation
por: Hirsch, Eran, et al.
Publicado: (2025)
por: Hirsch, Eran, et al.
Publicado: (2025)
Task-Circuit Quantization: Leveraging Knowledge Localization and Interpretability for Compression
por: Xiao, Hanqi, et al.
Publicado: (2025)
por: Xiao, Hanqi, et al.
Publicado: (2025)
CLATTER: Comprehensive Entailment Reasoning for Hallucination Detection
por: Eliav, Ron, et al.
Publicado: (2025)
por: Eliav, Ron, et al.
Publicado: (2025)
Skill-Based Mixture-of-Experts: Adaptive Routing for Heterogeneous Reasoning via Inferred Skills
por: Chen, Justin Chih-Yao, et al.
Publicado: (2025)
por: Chen, Justin Chih-Yao, et al.
Publicado: (2025)
Fundamental Problems With Model Editing: How Should Rational Belief Revision Work in LLMs?
por: Hase, Peter, et al.
Publicado: (2024)
por: Hase, Peter, et al.
Publicado: (2024)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
por: Wang, Ziyang, et al.
Publicado: (2024)
por: Wang, Ziyang, et al.
Publicado: (2024)
Executable Functional Abstractions: Inferring Generative Programs for Advanced Math Problems
por: Khan, Zaid, et al.
Publicado: (2025)
por: Khan, Zaid, et al.
Publicado: (2025)
Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty
por: Singh, Joykirat, et al.
Publicado: (2026)
por: Singh, Joykirat, et al.
Publicado: (2026)
SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models
por: Pham, Thinh, et al.
Publicado: (2025)
por: Pham, Thinh, et al.
Publicado: (2025)
Ejemplares similares
-
Multimodal Fact-Level Attribution for Verifiable Reasoning
por: Wan, David, et al.
Publicado: (2026) -
Retrieval-Augmented Generation with Conflicting Evidence
por: Wang, Han, et al.
Publicado: (2025) -
CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval
por: Wan, David, et al.
Publicado: (2025) -
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
por: Prasad, Archiki, et al.
Publicado: (2023) -
Generalized Correctness Models: Learning Calibrated and Model-Agnostic Correctness Predictors from Historical Patterns
por: Xiao, Hanqi, et al.
Publicado: (2025)