VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Inc, Xiaohongshu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
von: Lin, Bill Yuchen, et al.
Veröffentlicht: (2024)
von: Lin, Bill Yuchen, et al.
Veröffentlicht: (2024)
SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios
von: Chen, Junkai, et al.
Veröffentlicht: (2025)
von: Chen, Junkai, et al.
Veröffentlicht: (2025)
CO-Bench: Benchmarking Language Model Agents in Algorithm Search for Combinatorial Optimization
von: Sun, Weiwei, et al.
Veröffentlicht: (2025)
von: Sun, Weiwei, et al.
Veröffentlicht: (2025)
LongGenBench: Long-context Generation Benchmark
von: Liu, Xiang, et al.
Veröffentlicht: (2024)
von: Liu, Xiang, et al.
Veröffentlicht: (2024)
In Search of the Long-Tail: Systematic Generation of Long-Tail Inferential Knowledge via Logical Rule Guided Search
von: Li, Huihan, et al.
Veröffentlicht: (2023)
von: Li, Huihan, et al.
Veröffentlicht: (2023)
From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench
von: Xu, Ke, et al.
Veröffentlicht: (2026)
von: Xu, Ke, et al.
Veröffentlicht: (2026)
AnaloBench: Benchmarking the Identification of Abstract and Long-context Analogies
von: Ye, Xiao, et al.
Veröffentlicht: (2024)
von: Ye, Xiao, et al.
Veröffentlicht: (2024)
CocoaBench: Evaluating Unified Digital Agents in the Wild
von: CocoaBench Team, et al.
Veröffentlicht: (2026)
von: CocoaBench Team, et al.
Veröffentlicht: (2026)
ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation
von: Sun, Siqi, et al.
Veröffentlicht: (2026)
von: Sun, Siqi, et al.
Veröffentlicht: (2026)
PrefDisco: Benchmarking Proactive Personalized Reasoning
von: Li, Shuyue Stella, et al.
Veröffentlicht: (2025)
von: Li, Shuyue Stella, et al.
Veröffentlicht: (2025)
Benchmarking Deep Search over Heterogeneous Enterprise Data
von: Choubey, Prafulla Kumar, et al.
Veröffentlicht: (2025)
von: Choubey, Prafulla Kumar, et al.
Veröffentlicht: (2025)
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
von: Chen, Ziyang, et al.
Veröffentlicht: (2026)
von: Chen, Ziyang, et al.
Veröffentlicht: (2026)
$\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution
von: He, Muyu, et al.
Veröffentlicht: (2026)
von: He, Muyu, et al.
Veröffentlicht: (2026)
StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns
von: Wan, Luanbo, et al.
Veröffentlicht: (2025)
von: Wan, Luanbo, et al.
Veröffentlicht: (2025)
VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents
von: Chen, Yuhao, et al.
Veröffentlicht: (2026)
von: Chen, Yuhao, et al.
Veröffentlicht: (2026)
Controlling Logical Collapse in LLMs via Algebraic Ontology Projection over F2
von: Miyashita, Hisashi, et al.
Veröffentlicht: (2026)
von: Miyashita, Hisashi, et al.
Veröffentlicht: (2026)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
von: Song, Yuanyi, et al.
Veröffentlicht: (2025)
von: Song, Yuanyi, et al.
Veröffentlicht: (2025)
Mapping Overlaps in Benchmarks through Perplexity in the Wild
von: Wu, Siyang, et al.
Veröffentlicht: (2025)
von: Wu, Siyang, et al.
Veröffentlicht: (2025)
KLong: Training LLM Agent for Extremely Long-horizon Tasks
von: Liu, Yue, et al.
Veröffentlicht: (2026)
von: Liu, Yue, et al.
Veröffentlicht: (2026)
ACON: Optimizing Context Compression for Long-horizon LLM Agents
von: Kang, Minki, et al.
Veröffentlicht: (2025)
von: Kang, Minki, et al.
Veröffentlicht: (2025)
Mis-prompt: Benchmarking Large Language Models for Proactive Error Handling
von: Zeng, Jiayi, et al.
Veröffentlicht: (2025)
von: Zeng, Jiayi, et al.
Veröffentlicht: (2025)
Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments
von: Shi, Qinglong, et al.
Veröffentlicht: (2026)
von: Shi, Qinglong, et al.
Veröffentlicht: (2026)
REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents
von: Chu, Zheng, et al.
Veröffentlicht: (2026)
von: Chu, Zheng, et al.
Veröffentlicht: (2026)
ProAgent: Harnessing On-Demand Sensory Contexts for Proactive LLM Agent Systems in the Wild
von: Yang, Bufang, et al.
Veröffentlicht: (2025)
von: Yang, Bufang, et al.
Veröffentlicht: (2025)
AgentSearchBench: A Benchmark for AI Agent Search in the Wild
von: Wu, Bin, et al.
Veröffentlicht: (2026)
von: Wu, Bin, et al.
Veröffentlicht: (2026)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
von: Tang, Zecheng, et al.
Veröffentlicht: (2026)
von: Tang, Zecheng, et al.
Veröffentlicht: (2026)
Towards Long-horizon Agentic Multimodal Search
von: Du, Yifan, et al.
Veröffentlicht: (2026)
von: Du, Yifan, et al.
Veröffentlicht: (2026)
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
von: Yang, Wang, et al.
Veröffentlicht: (2025)
von: Yang, Wang, et al.
Veröffentlicht: (2025)
Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
von: Gao, Songyang, et al.
Veröffentlicht: (2025)
von: Gao, Songyang, et al.
Veröffentlicht: (2025)
JMMMU-Pro: Image-based Japanese Multi-discipline Multimodal Understanding Benchmark via Vibe Benchmark Construction
von: Miyai, Atsuyuki, et al.
Veröffentlicht: (2025)
von: Miyai, Atsuyuki, et al.
Veröffentlicht: (2025)
Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty
von: Wu, Peilin, et al.
Veröffentlicht: (2025)
von: Wu, Peilin, et al.
Veröffentlicht: (2025)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
von: Chen, Mingyang, et al.
Veröffentlicht: (2025)
von: Chen, Mingyang, et al.
Veröffentlicht: (2025)
VibeCheck: Discover and Quantify Qualitative Differences in Large Language Models
von: Dunlap, Lisa, et al.
Veröffentlicht: (2024)
von: Dunlap, Lisa, et al.
Veröffentlicht: (2024)
Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development
von: Tran, Hung, et al.
Veröffentlicht: (2026)
von: Tran, Hung, et al.
Veröffentlicht: (2026)
MileBench: Benchmarking MLLMs in Long Context
von: Song, Dingjie, et al.
Veröffentlicht: (2024)
von: Song, Dingjie, et al.
Veröffentlicht: (2024)
Neural Attention Search
von: Deng, Difan, et al.
Veröffentlicht: (2025)
von: Deng, Difan, et al.
Veröffentlicht: (2025)
Search or Accelerate: Confidence-Switched Position Beam Search for Diffusion Language Models
von: Cao, Mingyu, et al.
Veröffentlicht: (2026)
von: Cao, Mingyu, et al.
Veröffentlicht: (2026)
Bridging the Gap: From Ad-hoc to Proactive Search in Conversations
von: Meng, Chuan, et al.
Veröffentlicht: (2025)
von: Meng, Chuan, et al.
Veröffentlicht: (2025)
Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2025)
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2025)
Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
von: Shen, Yiting, et al.
Veröffentlicht: (2026)
von: Shen, Yiting, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
von: Lin, Bill Yuchen, et al.
Veröffentlicht: (2024) -
SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios
von: Chen, Junkai, et al.
Veröffentlicht: (2025) -
CO-Bench: Benchmarking Language Model Agents in Algorithm Search for Combinatorial Optimization
von: Sun, Weiwei, et al.
Veröffentlicht: (2025) -
LongGenBench: Long-context Generation Benchmark
von: Liu, Xiang, et al.
Veröffentlicht: (2024) -
In Search of the Long-Tail: Systematic Generation of Long-Tail Inferential Knowledge via Logical Rule Guided Search
von: Li, Huihan, et al.
Veröffentlicht: (2023)