Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Jiachen, Zhu, Menghui, Rui, Renting, Shan, Rong, Zheng, Congmin, Chen, Bo, Xi, Yunjia, Lin, Jianghao, Liu, Weiwen, Tang, Ruiming, Yu, Yong, Zhang, Weinan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stop DDoS Attacking the Research Community with AI-Generated Survey Papers
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges
di: Xi, Yunjia, et al.
Pubblicazione: (2025)
di: Xi, Yunjia, et al.
Pubblicazione: (2025)
Superplatforms Have to Attack AI Agents
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
Modular Representation Compression: Adapting LLMs for Efficient and Effective Recommendations
di: Xi, Yunjia, et al.
Pubblicazione: (2026)
di: Xi, Yunjia, et al.
Pubblicazione: (2026)
Efficiency Unleashed: Inference Acceleration for LLM-based Recommender Systems with Speculative Decoding
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
Full-Stack Optimized Large Language Models for Lifelong Sequential Behavior Comprehension in Recommendation
di: Shan, Rong, et al.
Pubblicazione: (2025)
di: Shan, Rong, et al.
Pubblicazione: (2025)
MemoCRS: Memory-enhanced Sequential Conversational Recommender Systems with Large Language Models
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization
di: Zhu, Jiachen, et al.
Pubblicazione: (2026)
di: Zhu, Jiachen, et al.
Pubblicazione: (2026)
Play to Your Strengths: Collaborative Intelligence of Conventional Recommender Models and Large Language Models
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
Beyond Positive History: Re-ranking with List-level Hybrid Feedback
di: Weng, Muyan, et al.
Pubblicazione: (2024)
di: Weng, Muyan, et al.
Pubblicazione: (2024)
Contexting as Recommendation: Evolutionary Collaborative Filtering for Context Engineering
di: Zhu, Jiachen, et al.
Pubblicazione: (2026)
di: Zhu, Jiachen, et al.
Pubblicazione: (2026)
An Automatic Graph Construction Framework based on Large Language Models for Recommendation
di: Shan, Rong, et al.
Pubblicazione: (2024)
di: Shan, Rong, et al.
Pubblicazione: (2024)
Position: Academic Conferences are Potentially Facing Denominator Gaming Caused by Fully Automated Scientific Agents
di: Shan, Rong, et al.
Pubblicazione: (2026)
di: Shan, Rong, et al.
Pubblicazione: (2026)
InfoDeepSeek: Benchmarking Agentic Information Seeking for Retrieval-Augmented Generation
di: Xi, Yunjia, et al.
Pubblicazione: (2025)
di: Xi, Yunjia, et al.
Pubblicazione: (2025)
Efficient and Deployable Knowledge Infusion for Open-World Recommendations via Large Language Models
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
di: Xi, Yunjia, et al.
Pubblicazione: (2024)
Lifelong Personalized Low-Rank Adaptation of Large Language Models for Recommendation
di: Zhu, Jiachen, et al.
Pubblicazione: (2024)
di: Zhu, Jiachen, et al.
Pubblicazione: (2024)
A Survey on Diffusion Models for Recommender Systems
di: Lin, Jianghao, et al.
Pubblicazione: (2024)
di: Lin, Jianghao, et al.
Pubblicazione: (2024)
MassTool: A Multi-Task Search-Based Tool Retrieval Framework for Large Language Models
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
di: Lin, Jianghao, et al.
Pubblicazione: (2025)
ReLLa: Retrieval-enhanced Large Language Models for Lifelong Sequential Behavior Comprehension in Recommendation
di: Lin, Jianghao, et al.
Pubblicazione: (2023)
di: Lin, Jianghao, et al.
Pubblicazione: (2023)
Position: The Real Barrier to LLM Agent Usability is Agentic ROI
di: Liu, Weiwen, et al.
Pubblicazione: (2025)
di: Liu, Weiwen, et al.
Pubblicazione: (2025)
How Can Recommender Systems Benefit from Large Language Models: A Survey
di: Lin, Jianghao, et al.
Pubblicazione: (2023)
di: Lin, Jianghao, et al.
Pubblicazione: (2023)
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training
di: Qin, Jiarui, et al.
Pubblicazione: (2025)
di: Qin, Jiarui, et al.
Pubblicazione: (2025)
AgentNet: Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems
di: Yang, Yingxuan, et al.
Pubblicazione: (2025)
di: Yang, Yingxuan, et al.
Pubblicazione: (2025)
Large Language Models Make Sample-Efficient Recommender Systems
di: Lin, Jianghao, et al.
Pubblicazione: (2024)
di: Lin, Jianghao, et al.
Pubblicazione: (2024)
M-scan: A Multi-Scenario Causal-driven Adaptive Network for Recommendation
di: Zhu, Jiachen, et al.
Pubblicazione: (2024)
di: Zhu, Jiachen, et al.
Pubblicazione: (2024)
LIBER: Lifelong User Behavior Modeling Based on Large Language Models
di: Zhu, Chenxu, et al.
Pubblicazione: (2024)
di: Zhu, Chenxu, et al.
Pubblicazione: (2024)
Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoning
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
Generative Representational Learning of Foundation Models for Recommendation
di: Zhou, Zheli, et al.
Pubblicazione: (2025)
di: Zhou, Zheli, et al.
Pubblicazione: (2025)
DisCo: Towards Harmonious Disentanglement and Collaboration between Tabular and Semantic Space for Recommendation
di: Du, Kounianhua, et al.
Pubblicazione: (2024)
di: Du, Kounianhua, et al.
Pubblicazione: (2024)
MuonRec: Shifting the Optimizer Paradigm Beyond Adam in Scalable Generative Recommendation
di: Shan, Rong, et al.
Pubblicazione: (2026)
di: Shan, Rong, et al.
Pubblicazione: (2026)
ClickPrompt: CTR Models are Strong Prompt Generators for Adapting Language Models to CTR Prediction
di: Lin, Jianghao, et al.
Pubblicazione: (2023)
di: Lin, Jianghao, et al.
Pubblicazione: (2023)
D2K: Turning Historical Data into Retrievable Knowledge for Recommender Systems
di: Qin, Jiarui, et al.
Pubblicazione: (2024)
di: Qin, Jiarui, et al.
Pubblicazione: (2024)
FLIP: Fine-grained Alignment between ID-based Models and Pretrained Language Models for CTR Prediction
di: Wang, Hangyu, et al.
Pubblicazione: (2023)
di: Wang, Hangyu, et al.
Pubblicazione: (2023)
Retrieval-Oriented Knowledge for Click-Through Rate Prediction
di: Liu, Huanshuo, et al.
Pubblicazione: (2024)
di: Liu, Huanshuo, et al.
Pubblicazione: (2024)
LLM4Tag: Automatic Tagging System for Information Retrieval via Large Language Models
di: Tang, Ruiming, et al.
Pubblicazione: (2025)
di: Tang, Ruiming, et al.
Pubblicazione: (2025)
FINED: Feed Instance-Wise Information Need with Essential and Disentangled Parametric Knowledge from the Past
di: Du, Kounianhua, et al.
Pubblicazione: (2024)
di: Du, Kounianhua, et al.
Pubblicazione: (2024)
A Survey of AI Agent Protocols
di: Yang, Yingxuan, et al.
Pubblicazione: (2025)
di: Yang, Yingxuan, et al.
Pubblicazione: (2025)
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
di: Wang, Jingxing, et al.
Pubblicazione: (2026)
di: Wang, Jingxing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Stop DDoS Attacking the Research Community with AI-Generated Survey Papers
di: Lin, Jianghao, et al.
Pubblicazione: (2025) -
A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges
di: Xi, Yunjia, et al.
Pubblicazione: (2025) -
Superplatforms Have to Attack AI Agents
di: Lin, Jianghao, et al.
Pubblicazione: (2025) -
Modular Representation Compression: Adapting LLMs for Efficient and Effective Recommendations
di: Xi, Yunjia, et al.
Pubblicazione: (2026) -
Efficiency Unleashed: Inference Acceleration for LLM-based Recommender Systems with Speculative Decoding
di: Xi, Yunjia, et al.
Pubblicazione: (2024)