Salvato in:
| Autori principali: | Zhang, Zuhao, Yu, Chengyue, Li, Yuante, Zhuang, Chenyi, Mo, Linjian, Li, Shuai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2603.09652 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CharPoet: A Chinese Classical Poetry Generation System Based on Token-free LLM
di: Yu, Chengyue, et al.
Pubblicazione: (2024)
di: Yu, Chengyue, et al.
Pubblicazione: (2024)
Profile-Aware Maneuvering: A Dynamic Multi-Agent System for Robust GAIA Problem Solving by AWorld
di: Xie, Zhitian, et al.
Pubblicazione: (2025)
di: Xie, Zhitian, et al.
Pubblicazione: (2025)
MCPToolBench++: A Large Scale AI Agent Model Context Protocol MCP Tool Use Benchmark
di: Fan, Shiqing, et al.
Pubblicazione: (2025)
di: Fan, Shiqing, et al.
Pubblicazione: (2025)
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
di: Li, Hao, et al.
Pubblicazione: (2026)
di: Li, Hao, et al.
Pubblicazione: (2026)
LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation
di: Zheng, Xiangqing, et al.
Pubblicazione: (2025)
di: Zheng, Xiangqing, et al.
Pubblicazione: (2025)
VoiceBench: Benchmarking LLM-Based Voice Assistants
di: Chen, Yiming, et al.
Pubblicazione: (2024)
di: Chen, Yiming, et al.
Pubblicazione: (2024)
$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
di: Zhang, Haoran, et al.
Pubblicazione: (2026)
di: Zhang, Haoran, et al.
Pubblicazione: (2026)
AssistantX: An LLM-Powered Proactive Assistant in Collaborative Human-Populated Environment
di: Sun, Nan, et al.
Pubblicazione: (2024)
di: Sun, Nan, et al.
Pubblicazione: (2024)
Distribution Shift Alignment Helps LLMs Simulate Survey Response Distributions
di: Huang, Ji, et al.
Pubblicazione: (2025)
di: Huang, Ji, et al.
Pubblicazione: (2025)
AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?
di: Ran, Dezhi, et al.
Pubblicazione: (2025)
di: Ran, Dezhi, et al.
Pubblicazione: (2025)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
di: Long, Xiang, et al.
Pubblicazione: (2026)
di: Long, Xiang, et al.
Pubblicazione: (2026)
HTMLCure: Turning Browser Experience into State Guided Repair for Interactive HTML
di: Wu, Jiajun, et al.
Pubblicazione: (2026)
di: Wu, Jiajun, et al.
Pubblicazione: (2026)
Breaking the Length Barrier: LLM-Enhanced CTR Prediction in Long Textual User Behaviors
di: Geng, Binzong, et al.
Pubblicazione: (2024)
di: Geng, Binzong, et al.
Pubblicazione: (2024)
CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean
di: Long, Wentao, et al.
Pubblicazione: (2026)
di: Long, Wentao, et al.
Pubblicazione: (2026)
Learning the Interaction Prior for Protein-Protein Interaction Prediction: A Model-Agnostic Approach
di: Gao, Ziqi, et al.
Pubblicazione: (2026)
di: Gao, Ziqi, et al.
Pubblicazione: (2026)
LifelongAgentBench: Evaluating LLM Agents as Lifelong Learners
di: Zheng, Junhao, et al.
Pubblicazione: (2025)
di: Zheng, Junhao, et al.
Pubblicazione: (2025)
Alleviating LLM-based Generative Retrieval Hallucination in Alipay Search
di: Shen, Yedan, et al.
Pubblicazione: (2025)
di: Shen, Yedan, et al.
Pubblicazione: (2025)
AHP-Powered LLM Reasoning for Multi-Criteria Evaluation of Open-Ended Responses
di: Lu, Xiaotian, et al.
Pubblicazione: (2024)
di: Lu, Xiaotian, et al.
Pubblicazione: (2024)
PeriGuru: A Peripheral Robotic Mobile App Operation Assistant based on GUI Image Understanding and Prompting with LLM
di: Fu, Kelin, et al.
Pubblicazione: (2024)
di: Fu, Kelin, et al.
Pubblicazione: (2024)
Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation
di: Yang, Haoyue, et al.
Pubblicazione: (2026)
di: Yang, Haoyue, et al.
Pubblicazione: (2026)
SQLCritic: Correcting Text-to-SQL Generation via Clause-wise Critic
di: Chen, Jikai, et al.
Pubblicazione: (2025)
di: Chen, Jikai, et al.
Pubblicazione: (2025)
BotzoneBench: Scalable LLM Evaluation via Graded AI Anchors
di: Li, Lingfeng, et al.
Pubblicazione: (2026)
di: Li, Lingfeng, et al.
Pubblicazione: (2026)
OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries
di: Ravichandran, Sandhanakrishnan, et al.
Pubblicazione: (2025)
di: Ravichandran, Sandhanakrishnan, et al.
Pubblicazione: (2025)
ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants
di: Wang, Pei, et al.
Pubblicazione: (2026)
di: Wang, Pei, et al.
Pubblicazione: (2026)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
di: Tan, Sijun, et al.
Pubblicazione: (2024)
di: Tan, Sijun, et al.
Pubblicazione: (2024)
KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation
di: Chen, Tongbo, et al.
Pubblicazione: (2026)
di: Chen, Tongbo, et al.
Pubblicazione: (2026)
Manipulating LLM Web Agents with Indirect Prompt Injection Attack via HTML Accessibility Tree
di: Johnson, Sam, et al.
Pubblicazione: (2025)
di: Johnson, Sam, et al.
Pubblicazione: (2025)
Recon-Act: A Self-Evolving Multi-Agent Browser-Use System via Web Reconnaissance, Tool Generation, and Task Execution
di: He, Kaiwen, et al.
Pubblicazione: (2025)
di: He, Kaiwen, et al.
Pubblicazione: (2025)
PeopleSearchBench: A Multi-Dimensional Benchmark for Evaluating AI-Powered People Search Platforms
di: Wang, Wei, et al.
Pubblicazione: (2026)
di: Wang, Wei, et al.
Pubblicazione: (2026)
MiniLLM: On-Policy Distillation of Large Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2023)
di: Gu, Yuxian, et al.
Pubblicazione: (2023)
TokenPowerBench: Benchmarking the Power Consumption of LLM Inference
di: Niu, Chenxu, et al.
Pubblicazione: (2025)
di: Niu, Chenxu, et al.
Pubblicazione: (2025)
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
di: Xu, Zelai, et al.
Pubblicazione: (2025)
di: Xu, Zelai, et al.
Pubblicazione: (2025)
ArgLLM-App: An Interactive System for Argumentative Reasoning with Large Language Models
di: Dejl, Adam, et al.
Pubblicazione: (2026)
di: Dejl, Adam, et al.
Pubblicazione: (2026)
IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis
di: Li, Hanyu, et al.
Pubblicazione: (2025)
di: Li, Hanyu, et al.
Pubblicazione: (2025)
TextEditBench: Evaluating Reasoning-aware Text Editing Beyond Rendering
di: Gui, Rui, et al.
Pubblicazione: (2025)
di: Gui, Rui, et al.
Pubblicazione: (2025)
LLM App Squatting and Cloning
di: Xie, Yinglin, et al.
Pubblicazione: (2024)
di: Xie, Yinglin, et al.
Pubblicazione: (2024)
On the (In)Security of LLM App Stores
di: Hou, Xinyi, et al.
Pubblicazione: (2024)
di: Hou, Xinyi, et al.
Pubblicazione: (2024)
AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents
di: Guo, Zhengkang, et al.
Pubblicazione: (2026)
di: Guo, Zhengkang, et al.
Pubblicazione: (2026)
ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces
di: Li, Xiangyi, et al.
Pubblicazione: (2026)
di: Li, Xiangyi, et al.
Pubblicazione: (2026)
WaLLM -- Insights from an LLM-Powered Chatbot deployment via WhatsApp
di: Eltigani, Hiba, et al.
Pubblicazione: (2025)
di: Eltigani, Hiba, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CharPoet: A Chinese Classical Poetry Generation System Based on Token-free LLM
di: Yu, Chengyue, et al.
Pubblicazione: (2024) -
Profile-Aware Maneuvering: A Dynamic Multi-Agent System for Robust GAIA Problem Solving by AWorld
di: Xie, Zhitian, et al.
Pubblicazione: (2025) -
MCPToolBench++: A Large Scale AI Agent Model Context Protocol MCP Tool Use Benchmark
di: Fan, Shiqing, et al.
Pubblicazione: (2025) -
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
di: Li, Hao, et al.
Pubblicazione: (2026) -
LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation
di: Zheng, Xiangqing, et al.
Pubblicazione: (2025)