Jenius Agent: Towards Experience-Driven Accuracy Optimization in Real-World Scenarios
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xia, Defei, Pi, Bingfeng, Zhang, Shenbin, Hua, Song, Wei, Yunfei, Zuo, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
par: Song, Zhiheng, et autres
Publié: (2026)
par: Song, Zhiheng, et autres
Publié: (2026)
MobiFlow: Real-World Mobile Agent Benchmarking through Trajectory Fusion
par: Feng, Yunfei, et autres
Publié: (2026)
par: Feng, Yunfei, et autres
Publié: (2026)
RRNCO: Towards Real-World Routing with Neural Combinatorial Optimization
par: Son, Jiwoo, et autres
Publié: (2025)
par: Son, Jiwoo, et autres
Publié: (2025)
TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
par: Wei, Shaohang, et autres
Publié: (2025)
par: Wei, Shaohang, et autres
Publié: (2025)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
par: Shen, Yuanzhe, et autres
Publié: (2026)
par: Shen, Yuanzhe, et autres
Publié: (2026)
Smart Language Agents in Real-World Planning
par: Miin, Annabelle, et autres
Publié: (2024)
par: Miin, Annabelle, et autres
Publié: (2024)
MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
par: Li, Zhang, et autres
Publié: (2026)
par: Li, Zhang, et autres
Publié: (2026)
Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios
par: Chen, Zhi, et autres
Publié: (2025)
par: Chen, Zhi, et autres
Publié: (2025)
Toward Real-World Cooperative and Competitive Soccer with Quadrupedal Robot Teams
par: Su, Zhi, et autres
Publié: (2025)
par: Su, Zhi, et autres
Publié: (2025)
RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios
par: Zhou, Ruiwen, et autres
Publié: (2024)
par: Zhou, Ruiwen, et autres
Publié: (2024)
UniTalk: Towards Universal Active Speaker Detection in Real World Scenarios
par: Nguyen, Le Thien Phuc, et autres
Publié: (2025)
par: Nguyen, Le Thien Phuc, et autres
Publié: (2025)
Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents
par: Fan, Zhiyuan, et autres
Publié: (2026)
par: Fan, Zhiyuan, et autres
Publié: (2026)
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
par: Lu, Jiaxuan, et autres
Publié: (2026)
par: Lu, Jiaxuan, et autres
Publié: (2026)
An Agent-Oriented Pluggable Experience-RAG Skill for Experience-Driven Retrieval Strategy Orchestration
par: Zhang, Dutao, et autres
Publié: (2026)
par: Zhang, Dutao, et autres
Publié: (2026)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
par: Wu, Yao, et autres
Publié: (2026)
par: Wu, Yao, et autres
Publié: (2026)
From Real-World Traffic Data to Relevant Critical Scenarios
par: Lüttner, Florian, et autres
Publié: (2025)
par: Lüttner, Florian, et autres
Publié: (2025)
Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization
par: Jia, Hangyi, et autres
Publié: (2025)
par: Jia, Hangyi, et autres
Publié: (2025)
MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution
par: Sun, Libo, et autres
Publié: (2026)
par: Sun, Libo, et autres
Publié: (2026)
Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence
par: Dong, Guanting, et autres
Publié: (2026)
par: Dong, Guanting, et autres
Publié: (2026)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
par: Gao, Zeyu, et autres
Publié: (2025)
par: Gao, Zeyu, et autres
Publié: (2025)
Advancing MAPF Toward the Real World: A Scalable Multi-Agent Realistic Testbed (SMART)
par: Yan, Jingtian, et autres
Publié: (2025)
par: Yan, Jingtian, et autres
Publié: (2025)
OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
par: Hu, Mengkang, et autres
Publié: (2025)
par: Hu, Mengkang, et autres
Publié: (2025)
World Models as an Intermediary between Agents and the Real World
par: Yang, Sherry
Publié: (2026)
par: Yang, Sherry
Publié: (2026)
The ORCA Benchmark: Evaluating Real-World Calculation Accuracy in Large Language Models
par: Herambourg, Claudia, et autres
Publié: (2025)
par: Herambourg, Claudia, et autres
Publié: (2025)
SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?
par: Han, Tingxu, et autres
Publié: (2026)
par: Han, Tingxu, et autres
Publié: (2026)
ReCreate: Reasoning and Creating Domain Agents Driven by Experience
par: Hao, Zhezheng, et autres
Publié: (2026)
par: Hao, Zhezheng, et autres
Publié: (2026)
TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
par: Chu, Zhaoyang, et autres
Publié: (2026)
par: Chu, Zhaoyang, et autres
Publié: (2026)
Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization
par: Chi, Yizhe, et autres
Publié: (2026)
par: Chi, Yizhe, et autres
Publié: (2026)
Transferable Expertise for Autonomous Agents via Real-World Case-Based Learning
par: Ma, Zhenyu, et autres
Publié: (2026)
par: Ma, Zhenyu, et autres
Publié: (2026)
Paladin-mini: A Compact and Efficient Grounding Model Excelling in Real-World Scenarios
par: Ivry, Dror, et autres
Publié: (2025)
par: Ivry, Dror, et autres
Publié: (2025)
NEWSAGENT: Benchmarking Multimodal Agents as Journalists with Real-World Newswriting Tasks
par: Chien, Yen-Che, et autres
Publié: (2025)
par: Chien, Yen-Che, et autres
Publié: (2025)
Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios
par: Chen, Zhi, et autres
Publié: (2024)
par: Chen, Zhi, et autres
Publié: (2024)
Exploring the Necessity of Reasoning in LLM-based Agent Scenarios
par: Zhou, Xueyang, et autres
Publié: (2025)
par: Zhou, Xueyang, et autres
Publié: (2025)
SCoGen: Scenario-Centric Graph-Based Synthesis of Real-World Code Problems
par: Yao, Xifeng, et autres
Publié: (2025)
par: Yao, Xifeng, et autres
Publié: (2025)
USM: Unbiased Survey Modeling for Limiting Negative User Experiences in Recommendation Systems
par: Yu, Chenghui, et autres
Publié: (2024)
par: Yu, Chenghui, et autres
Publié: (2024)
GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World Anomalies
par: Yang, Jingqi, et autres
Publié: (2025)
par: Yang, Jingqi, et autres
Publié: (2025)
Towards Apples to Apples for AI Evaluations: From Real-World Use Cases to Evaluation Scenarios
par: Choong, Yee-Yin, et autres
Publié: (2026)
par: Choong, Yee-Yin, et autres
Publié: (2026)
ALOPE: Adaptive Layer Optimization for Translation Quality Estimation using Large Language Models
par: Sindhujan, Archchana, et autres
Publié: (2025)
par: Sindhujan, Archchana, et autres
Publié: (2025)
Towards Evaluation for Real-World LLM Unlearning
par: Miao, Ke, et autres
Publié: (2025)
par: Miao, Ke, et autres
Publié: (2025)
Improving Generalization of Speech Separation in Real-World Scenarios: Strategies in Simulation, Optimization, and Evaluation
par: Chen, Ke, et autres
Publié: (2024)
par: Chen, Ke, et autres
Publié: (2024)
Documents similaires
-
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
par: Song, Zhiheng, et autres
Publié: (2026) -
MobiFlow: Real-World Mobile Agent Benchmarking through Trajectory Fusion
par: Feng, Yunfei, et autres
Publié: (2026) -
RRNCO: Towards Real-World Routing with Neural Combinatorial Optimization
par: Son, Jiwoo, et autres
Publié: (2025) -
TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
par: Wei, Shaohang, et autres
Publié: (2025) -
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
par: Shen, Yuanzhe, et autres
Publié: (2026)