BRIGHT+: Upgrading the BRIGHT Benchmark with MARCUS, a Multi-Agent RAG Clean-Up Suite
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Liyang, Cai, Yujun, Dong, Jieqiong, Wang, Yiwei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive Retrieval
par: Su, Hongjin, et autres
Publié: (2024)
par: Su, Hongjin, et autres
Publié: (2024)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
par: Chen, Liyang, et autres
Publié: (2026)
par: Chen, Liyang, et autres
Publié: (2026)
BRIGHT: A globally distributed multimodal building damage assessment dataset with very-high-resolution for all-weather disaster response
par: Chen, Hongruixuan, et autres
Publié: (2025)
par: Chen, Hongruixuan, et autres
Publié: (2025)
BRIGHT STAR ASTROMETRY WITH URAT
par: N. Zacharias
Publié: (2015)
par: N. Zacharias
Publié: (2015)
Token-Efficient Prompt Injection Attack: Provoking Cessation in LLM Reasoning via Adaptive Token Compression
par: Cui, Yu, et autres
Publié: (2025)
par: Cui, Yu, et autres
Publié: (2025)
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
par: Fu, Honghao, et autres
Publié: (2026)
par: Fu, Honghao, et autres
Publié: (2026)
Cure or Poison? Embedding Instructions Visually Alters Hallucination in Vision-Language Models
par: Wang, Zhaochen, et autres
Publié: (2025)
par: Wang, Zhaochen, et autres
Publié: (2025)
Process or Result? Manipulated Ending Tokens Can Mislead Reasoning LLMs to Ignore the Correct Reasoning Steps
par: Cui, Yu, et autres
Publié: (2025)
par: Cui, Yu, et autres
Publié: (2025)
ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
par: Wu, Yike, et autres
Publié: (2025)
par: Wu, Yike, et autres
Publié: (2025)
MM-BRIGHT: A Multi-Task Multimodal Benchmark for Reasoning-Intensive Retrieval
par: Abdallah, Abdelrahman, et autres
Publié: (2026)
par: Abdallah, Abdelrahman, et autres
Publié: (2026)
An Executable Benchmarking Suite for Tool-Using Agents
par: Zhong, Zhiqing, et autres
Publié: (2026)
par: Zhong, Zhiqing, et autres
Publié: (2026)
Self-Manager: Parallel Agent Loop for Long-form Deep Research
par: Xu, Yilong, et autres
Publié: (2026)
par: Xu, Yilong, et autres
Publié: (2026)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
par: Sun, Zhe, et autres
Publié: (2025)
par: Sun, Zhe, et autres
Publié: (2025)
MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
par: Ge, Haonan, et autres
Publié: (2025)
par: Ge, Haonan, et autres
Publié: (2025)
Primacy Effect of ChatGPT
par: Wang, Yiwei, et autres
Publié: (2023)
par: Wang, Yiwei, et autres
Publié: (2023)
MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management
par: O'Sullivan, Jack W, et autres
Publié: (2026)
par: O'Sullivan, Jack W, et autres
Publié: (2026)
THE BRIGHT FUTURE OF THE ASTROPHYSICAL MAGNETIC FIELD RESEARCH
par: A. Lazarian
Publié: (2009)
par: A. Lazarian
Publié: (2009)
AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
par: Bragg, Jonathan, et autres
Publié: (2025)
par: Bragg, Jonathan, et autres
Publié: (2025)
RefineShot: Rethinking Cinematography Understanding with Foundational Skill Evaluation
par: Wu, Hang, et autres
Publié: (2025)
par: Wu, Hang, et autres
Publié: (2025)
Revisiting RAG Ensemble: A Theoretical and Mechanistic Analysis of Multi-RAG System Collaboration
par: Chen, Yifei, et autres
Publié: (2025)
par: Chen, Yifei, et autres
Publié: (2025)
COMMA: A Communicative Multimodal Multi-Agent Benchmark
par: Ossowski, Timothy, et autres
Publié: (2024)
par: Ossowski, Timothy, et autres
Publié: (2024)
EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design
par: Molinari, Gioele, et autres
Publié: (2026)
par: Molinari, Gioele, et autres
Publié: (2026)
BRIGHT PROSPECTS OR AN OMINOUS FUTURE. Anticipating Oil in Uganda
par: Annika Witte
Publié: (2017)
par: Annika Witte
Publié: (2017)
MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability
par: Ma, Tie, et autres
Publié: (2026)
par: Ma, Tie, et autres
Publié: (2026)
SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades
par: Lam, Man Ho, et autres
Publié: (2026)
par: Lam, Man Ho, et autres
Publié: (2026)
ContextNav: Towards Agentic Multimodal In-Context Learning
par: Fu, Honghao, et autres
Publié: (2025)
par: Fu, Honghao, et autres
Publié: (2025)
MultiTab: A Comprehensive Benchmark Suite for Multi-Dimensional Evaluation in Tabular Domains
par: Lee, Kyungeun, et autres
Publié: (2025)
par: Lee, Kyungeun, et autres
Publié: (2025)
BioAgent Bench: An AI Agent Evaluation Suite for Bioinformatics
par: Fa, Dionizije, et autres
Publié: (2026)
par: Fa, Dionizije, et autres
Publié: (2026)
MoDeSuite: Robot Learning Task Suite for Benchmarking Mobile Manipulation with Deformable Objects
par: Zhang, Yuying, et autres
Publié: (2025)
par: Zhang, Yuying, et autres
Publié: (2025)
MobileAgentBench: An Efficient and User-Friendly Benchmark for Mobile LLM Agents
par: Wang, Luyuan, et autres
Publié: (2024)
par: Wang, Luyuan, et autres
Publié: (2024)
WavefrontDiffusion: Dynamic Decoding Schedule for Improved Reasoning
par: Yang, Haojin, et autres
Publié: (2025)
par: Yang, Haojin, et autres
Publié: (2025)
Enhancing LLM Character-Level Manipulation via Divide and Conquer
par: Xiong, Zhen, et autres
Publié: (2025)
par: Xiong, Zhen, et autres
Publié: (2025)
A MYSTERIOUS UNIVERSE REVEALING THE BRIGHT AND DARK SIDES OF THE COSMOS
par: Susana Planelles
Publié: (2017)
par: Susana Planelles
Publié: (2017)
PA-RAG: RAG Alignment via Multi-Perspective Preference Optimization
par: Wu, Jiayi, et autres
Publié: (2024)
par: Wu, Jiayi, et autres
Publié: (2024)
PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs
par: Sun, Bowen, et autres
Publié: (2025)
par: Sun, Bowen, et autres
Publié: (2025)
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
par: Ge, Haonan, et autres
Publié: (2025)
par: Ge, Haonan, et autres
Publié: (2025)
Experience as a Compass: Multi-agent RAG with Evolving Orchestration and Agent Prompts
par: Li, Sha, et autres
Publié: (2026)
par: Li, Sha, et autres
Publié: (2026)
BRIGHT: A Collaborative Generalist-Specialist Foundation Model for Breast Pathology
par: Guo, Xiaojing, et autres
Publié: (2026)
par: Guo, Xiaojing, et autres
Publié: (2026)
Clean First, Align Later: Benchmarking Preference Data Cleaning for Reliable LLM Alignment
par: Yeh, Samuel, et autres
Publié: (2025)
par: Yeh, Samuel, et autres
Publié: (2025)
VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft
par: Fu, Honghao, et autres
Publié: (2025)
par: Fu, Honghao, et autres
Publié: (2025)
Documents similaires
-
BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive Retrieval
par: Su, Hongjin, et autres
Publié: (2024) -
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
par: Chen, Liyang, et autres
Publié: (2026) -
BRIGHT: A globally distributed multimodal building damage assessment dataset with very-high-resolution for all-weather disaster response
par: Chen, Hongruixuan, et autres
Publié: (2025) -
BRIGHT STAR ASTROMETRY WITH URAT
par: N. Zacharias
Publié: (2015) -
Token-Efficient Prompt Injection Attack: Provoking Cessation in LLM Reasoning via Adaptive Token Compression
par: Cui, Yu, et autres
Publié: (2025)