DetectBench: Can Large Language Model Detect and Piece Together Implicit Evidence?
Fuente:
arXiv
Saved in:
| Main Authors: | Gu, Zhouhong, Zhang, Lin, Zhu, Xiaoxuan, Chen, Jiangjie, Huang, Wenhao, Zhang, Yikai, Wang, Shusen, Ye, Zheyu, Gao, Yan, Feng, Hongwei, Xiao, Yanghua |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Piecing Together Clues: A Benchmark for Evaluating the Detective Skills of Large Language Models
by: Gu, Zhouhong, et al.
Published: (2023)
by: Gu, Zhouhong, et al.
Published: (2023)
RECKON: Large-scale Reference-based Efficient Knowledge Evaluation for Large Language Model
by: Zhang, Lin, et al.
Published: (2025)
by: Zhang, Lin, et al.
Published: (2025)
AgentGroupChat: An Interactive Group Chat Simulacra For Better Eliciting Emergent Behavior
by: Gu, Zhouhong, et al.
Published: (2024)
by: Gu, Zhouhong, et al.
Published: (2024)
VCEval: Rethinking What is a Good Educational Video and How to Automatically Evaluate It
by: Zhu, Xiaoxuan, et al.
Published: (2024)
by: Zhu, Xiaoxuan, et al.
Published: (2024)
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
by: Gu, Zhouhong, et al.
Published: (2024)
by: Gu, Zhouhong, et al.
Published: (2024)
Efficiently Quantifying and Mitigating Ripple Effects in Model Editing
by: Wang, Jianchen, et al.
Published: (2024)
by: Wang, Jianchen, et al.
Published: (2024)
LLM-GAN: Construct Generative Adversarial Network Through Large Language Models For Explainable Fake News Detection
by: Wang, Yifeng, et al.
Published: (2024)
by: Wang, Yifeng, et al.
Published: (2024)
ToReMi: Topic-Aware Data Reweighting for Dynamic Pre-Training Data Selection
by: Zhu, Xiaoxuan, et al.
Published: (2025)
by: Zhu, Xiaoxuan, et al.
Published: (2025)
Can LLMs Learn to Map the World from Local Descriptions?
by: Xia, Sirui, et al.
Published: (2025)
by: Xia, Sirui, et al.
Published: (2025)
Enhancing Language Agent Strategic Reasoning through Self-Play in Adversarial Games
by: Zhang, Yikai, et al.
Published: (2025)
by: Zhang, Yikai, et al.
Published: (2025)
MCiteBench: A Multimodal Benchmark for Generating Text with Citations
by: Hu, Caiyu, et al.
Published: (2025)
by: Hu, Caiyu, et al.
Published: (2025)
LITE: LLM-Impelled efficient Taxonomy Evaluation
by: Zhang, Lin, et al.
Published: (2025)
by: Zhang, Lin, et al.
Published: (2025)
Can Large Language Models Understand Real-World Complex Instructions?
by: He, Qianyu, et al.
Published: (2023)
by: He, Qianyu, et al.
Published: (2023)
TimeArena: Shaping Efficient Multitasking Language Agents in a Time-Aware Simulation
by: Zhang, Yikai, et al.
Published: (2024)
by: Zhang, Yikai, et al.
Published: (2024)
MIRAGE: Exploring How Large Language Models Perform in Complex Social Interactive Environments
by: Cai, Yin, et al.
Published: (2025)
by: Cai, Yin, et al.
Published: (2025)
Rethinking Layer-wise Gaussian Noise Injection: Bridging Implicit Objectives and Privacy Budget Allocation
by: Tan, Qifeng, et al.
Published: (2025)
by: Tan, Qifeng, et al.
Published: (2025)
AgentGroupChat-V2: Divide-and-Conquer Is What LLM-Based Multi-Agent System Need
by: Gu, Zhouhong, et al.
Published: (2025)
by: Gu, Zhouhong, et al.
Published: (2025)
GAPO: Learning Preferential Prompt through Generative Adversarial Policy Optimization
by: Gu, Zhouhong, et al.
Published: (2025)
by: Gu, Zhouhong, et al.
Published: (2025)
Revealing the Barriers of Language Agents in Planning
by: Xie, Jian, et al.
Published: (2024)
by: Xie, Jian, et al.
Published: (2024)
Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation
by: Gu, Zhouhong, et al.
Published: (2023)
by: Gu, Zhouhong, et al.
Published: (2023)
Scaling Behavior of Single LLM-Driven Multi-Agent Systems
by: Li, Jialing, et al.
Published: (2026)
by: Li, Jialing, et al.
Published: (2026)
ARIA: Training Language Agents with Intention-Driven Reward Aggregation
by: Yang, Ruihan, et al.
Published: (2025)
by: Yang, Ruihan, et al.
Published: (2025)
SelfGoal: Your Language Agents Already Know How to Achieve High-level Goals
by: Yang, Ruihan, et al.
Published: (2024)
by: Yang, Ruihan, et al.
Published: (2024)
How Easily do Irrelevant Inputs Skew the Responses of Large Language Models?
by: Wu, Siye, et al.
Published: (2024)
by: Wu, Siye, et al.
Published: (2024)
AutoScraper: A Progressive Understanding Web Agent for Web Scraper Generation
by: Huang, Wenhao, et al.
Published: (2024)
by: Huang, Wenhao, et al.
Published: (2024)
ConcEPT: Concept-Enhanced Pre-Training for Language Models
by: Wang, Xintao, et al.
Published: (2024)
by: Wang, Xintao, et al.
Published: (2024)
CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning
by: Wu, Siye, et al.
Published: (2026)
by: Wu, Siye, et al.
Published: (2026)
PII-Bench: Evaluating Query-Aware Privacy Protection Systems
by: Shen, Hao, et al.
Published: (2025)
by: Shen, Hao, et al.
Published: (2025)
TESSELLATE: Piecing Together the Variable Sky With TESS
by: Roxburgh, Hugh, et al.
Published: (2025)
by: Roxburgh, Hugh, et al.
Published: (2025)
Embedded Course Reserves: Piecing the Puzzle Together
by: Clumpner, Krista E., et al.
Published: (2011)
by: Clumpner, Krista E., et al.
Published: (2011)
DEEPER Insight into Your User: Directed Persona Refinement for Dynamic Persona Modeling
by: Chen, Aili, et al.
Published: (2025)
by: Chen, Aili, et al.
Published: (2025)
PowerAttention: Exponentially Scaling of Receptive Fields for Effective Sparse Attention
by: Chen, Lida, et al.
Published: (2025)
by: Chen, Lida, et al.
Published: (2025)
Piece it Together: Part-Based Concepting with IP-Priors
by: Richardson, Elad, et al.
Published: (2025)
by: Richardson, Elad, et al.
Published: (2025)
GumbelSoft: Diversified Language Model Watermarking via the GumbelMax-trick
by: Fu, Jiayi, et al.
Published: (2024)
by: Fu, Jiayi, et al.
Published: (2024)
TravelAgent: An AI Assistant for Personalized Travel Planning
by: Chen, Aili, et al.
Published: (2024)
by: Chen, Aili, et al.
Published: (2024)
Past Meets Present: Creating Historical Analogy with Large Language Models
by: Li, Nianqi, et al.
Published: (2024)
by: Li, Nianqi, et al.
Published: (2024)
Piecing It All Together: Verifying Multi-Hop Multimodal Claims
by: Wang, Haoran, et al.
Published: (2024)
by: Wang, Haoran, et al.
Published: (2024)
Fitting the Pieces Together: Developing Better Service for End-Users.
by: Bridges, Peggy Bass, et al.
Published: (2000)
by: Bridges, Peggy Bass, et al.
Published: (2000)
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning
by: Li, Jiachun, et al.
Published: (2026)
by: Li, Jiachun, et al.
Published: (2026)
Erythropoietin Expression and Regulation: Piecing Together Known Mechanisms and Emerging Insights
by: Salam Idriss, et al.
Published: (2026)
by: Salam Idriss, et al.
Published: (2026)
Similar Items
-
Piecing Together Clues: A Benchmark for Evaluating the Detective Skills of Large Language Models
by: Gu, Zhouhong, et al.
Published: (2023) -
RECKON: Large-scale Reference-based Efficient Knowledge Evaluation for Large Language Model
by: Zhang, Lin, et al.
Published: (2025) -
AgentGroupChat: An Interactive Group Chat Simulacra For Better Eliciting Emergent Behavior
by: Gu, Zhouhong, et al.
Published: (2024) -
VCEval: Rethinking What is a Good Educational Video and How to Automatically Evaluate It
by: Zhu, Xiaoxuan, et al.
Published: (2024) -
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
by: Gu, Zhouhong, et al.
Published: (2024)