Tur[k]ingBench: A Challenge Benchmark for Web Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Kevin, Kordi, Yeganeh, Nayak, Tanay, Asija, Adi, Wang, Yizhong, Sanders, Kate, Byerly, Adam, Zhang, Jingyu, Van Durme, Benjamin, Khashabi, Daniel |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GOLD PANNING: Strategic Context Shuffling for Needle-in-Haystack Reasoning
par: Byerly, Adam, et autres
Publié: (2025)
par: Byerly, Adam, et autres
Publié: (2025)
Self-Consistency Falls Short! The Adverse Effects of Positional Bias on Long-Context Problems
par: Byerly, Adam, et autres
Publié: (2024)
par: Byerly, Adam, et autres
Publié: (2024)
Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation
par: Wang, Hexuan, et autres
Publié: (2026)
par: Wang, Hexuan, et autres
Publié: (2026)
Hell or High Water: Evaluating Agentic Recovery from External Failures
par: Wang, Andrew, et autres
Publié: (2025)
par: Wang, Andrew, et autres
Publié: (2025)
Bonsai: Interpretable Tree-Adaptive Grounded Reasoning
par: Sanders, Kate, et autres
Publié: (2025)
par: Sanders, Kate, et autres
Publié: (2025)
A Survey of Video Datasets for Grounded Event Understanding
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
Core: Robust Factual Precision with Informative Sub-Claim Identification
par: Jiang, Zhengping, et autres
Publié: (2024)
par: Jiang, Zhengping, et autres
Publié: (2024)
Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data
par: Zhang, Jingyu, et autres
Publié: (2024)
par: Zhang, Jingyu, et autres
Publié: (2024)
Certified Mitigation of Worst-Case LLM Copyright Infringement
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
SocialNLI: A Dialogue-Centric Social Inference Dataset
par: Deo, Akhil, et autres
Publié: (2025)
par: Deo, Akhil, et autres
Publié: (2025)
Crystal: Characterizing Relative Impact of Scholarly Publications
par: Collison, Hannah, et autres
Publié: (2026)
par: Collison, Hannah, et autres
Publié: (2026)
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
par: Zhang, Jingyu, et autres
Publié: (2024)
par: Zhang, Jingyu, et autres
Publié: (2024)
TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
DeonticBench: A Benchmark for Reasoning over Rules
par: Dou, Guangyao, et autres
Publié: (2026)
par: Dou, Guangyao, et autres
Publié: (2026)
arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
par: Wang, Weiqi, et autres
Publié: (2025)
par: Wang, Weiqi, et autres
Publié: (2025)
Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find
par: Bianchi, Owen, et autres
Publié: (2025)
par: Bianchi, Owen, et autres
Publié: (2025)
Insights into LLM Long-Context Failures: When Transformers Know but Don't Tell
par: Lu, Taiming, et autres
Publié: (2024)
par: Lu, Taiming, et autres
Publié: (2024)
WorldAPIs: The World Is Worth How Many APIs? A Thought Experiment
par: Ou, Jiefu, et autres
Publié: (2024)
par: Ou, Jiefu, et autres
Publié: (2024)
Many-Tier Instruction Hierarchy in LLM Agents
par: Zhang, Jingyu, et autres
Publié: (2026)
par: Zhang, Jingyu, et autres
Publié: (2026)
Revisiting Generalization Across Difficulty Levels: It's Not So Easy
par: Kordi, Yeganeh, et autres
Publié: (2025)
par: Kordi, Yeganeh, et autres
Publié: (2025)
Jailbreak Distillation: Renewable Safety Benchmarking
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
BenchCLAMP: A Benchmark for Evaluating Language Models on Syntactic and Semantic Parsing
par: Roy, Subhro, et autres
Publié: (2022)
par: Roy, Subhro, et autres
Publié: (2022)
k-SemStamp: A Clustering-Based Semantic Watermark for Detection of Machine-Generated Text
par: Hou, Abe Bohan, et autres
Publié: (2024)
par: Hou, Abe Bohan, et autres
Publié: (2024)
RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
RORA: Robust Free-Text Rationale Evaluation
par: Jiang, Zhengping, et autres
Publié: (2024)
par: Jiang, Zhengping, et autres
Publié: (2024)
Dated Data: Tracing Knowledge Cutoffs in Large Language Models
par: Cheng, Jeffrey, et autres
Publié: (2024)
par: Cheng, Jeffrey, et autres
Publié: (2024)
TurBLiMP: A Turkish Benchmark of Linguistic Minimal Pairs
par: Başar, Ezgi, et autres
Publié: (2025)
par: Başar, Ezgi, et autres
Publié: (2025)
Challenging the Evaluator: LLM Sycophancy Under User Rebuttal
par: Kim, Sungwon, et autres
Publié: (2025)
par: Kim, Sungwon, et autres
Publié: (2025)
Grounding Partially-Defined Events in Multimodal Data
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
"According to ...": Prompting Language Models Improves Quoting from Pre-Training Data
par: Weller, Orion, et autres
Publié: (2023)
par: Weller, Orion, et autres
Publié: (2023)
DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models
par: Tiwari, Utkarsh, et autres
Publié: (2025)
par: Tiwari, Utkarsh, et autres
Publié: (2025)
The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
MultiVENT 2.0: A Massive Multilingual Benchmark for Event-Centric Video Retrieval
par: Kriz, Reno, et autres
Publié: (2024)
par: Kriz, Reno, et autres
Publié: (2024)
WikiVideo: Article Generation from Multiple Videos
par: Martin, Alexander, et autres
Publié: (2025)
par: Martin, Alexander, et autres
Publié: (2025)
Seeing Through the MiRAGE: Evaluating Multimodal Retrieval Augmented Generation
par: Martin, Alexander, et autres
Publié: (2025)
par: Martin, Alexander, et autres
Publié: (2025)
Computer Cache. Online Recess--Web Games for Play and Fun
par: Byerly, Greg, et autres
Publié: (2005)
par: Byerly, Greg, et autres
Publié: (2005)
LLMs Provide Unstable Answers to Legal Questions
par: Blair-Stanek, Andrew, et autres
Publié: (2025)
par: Blair-Stanek, Andrew, et autres
Publié: (2025)
SemStamp: A Semantic Watermark with Paraphrastic Robustness for Text Generation
par: Hou, Abe Bohan, et autres
Publié: (2023)
par: Hou, Abe Bohan, et autres
Publié: (2023)
TurQUaz at CheckThat! 2025: Debating Large Language Models for Scientific Web Discourse Detection
par: Saraç, Tarık, et autres
Publié: (2025)
par: Saraç, Tarık, et autres
Publié: (2025)
Documents similaires
-
GOLD PANNING: Strategic Context Shuffling for Needle-in-Haystack Reasoning
par: Byerly, Adam, et autres
Publié: (2025) -
Self-Consistency Falls Short! The Adverse Effects of Positional Bias on Long-Context Problems
par: Byerly, Adam, et autres
Publié: (2024) -
Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation
par: Wang, Hexuan, et autres
Publié: (2026) -
Hell or High Water: Evaluating Agentic Recovery from External Failures
par: Wang, Andrew, et autres
Publié: (2025) -
Bonsai: Interpretable Tree-Adaptive Grounded Reasoning
par: Sanders, Kate, et autres
Publié: (2025)