Empowering Real-World: A Survey on the Technology, Practice, and Evaluation of LLM-driven Industry Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Tang, Yihong, Chen, Kehai, Yue, Liang, Fan, Jinxin, Zhou, Caishen, Li, Xiaoguang, Zhang, Yuyang, Zhao, Mingming, Kai, Shixiong, Guo, Kaiyang, Zeng, Xingshan, Cun, Wenjing, Shang, Lifeng, Zhang, Min |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
por: Zhao, Wenshuo, et al.
Publicado: (2026)
por: Zhao, Wenshuo, et al.
Publicado: (2026)
Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios
por: Huang, Shijue, et al.
Publicado: (2024)
por: Huang, Shijue, et al.
Publicado: (2024)
Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent
por: Tang, Yihong, et al.
Publicado: (2026)
por: Tang, Yihong, et al.
Publicado: (2026)
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
por: Jiang, Yuxin, et al.
Publicado: (2026)
por: Jiang, Yuxin, et al.
Publicado: (2026)
Position: The Real Barrier to LLM Agent Usability is Agentic ROI
por: Liu, Weiwen, et al.
Publicado: (2025)
por: Liu, Weiwen, et al.
Publicado: (2025)
ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation
por: Zeng, Xingshan, et al.
Publicado: (2026)
por: Zeng, Xingshan, et al.
Publicado: (2026)
CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents
por: Tang, Yihong, et al.
Publicado: (2026)
por: Tang, Yihong, et al.
Publicado: (2026)
ORPP: Self-Optimizing Role-playing Prompts to Enhance Language Model Capabilities
por: Duan, Yifan, et al.
Publicado: (2025)
por: Duan, Yifan, et al.
Publicado: (2025)
MASTER: Enhancing Large Language Model via Multi-Agent Simulated Teaching
por: Yue, Liang, et al.
Publicado: (2025)
por: Yue, Liang, et al.
Publicado: (2025)
ELAIPBench: A Benchmark for Expert-Level Artificial Intelligence Paper Understanding
por: Dai, Xinbang, et al.
Publicado: (2025)
por: Dai, Xinbang, et al.
Publicado: (2025)
UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
por: Liu, Chang, et al.
Publicado: (2026)
por: Liu, Chang, et al.
Publicado: (2026)
M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language Models
por: Kwan, Wai-Chung, et al.
Publicado: (2023)
por: Kwan, Wai-Chung, et al.
Publicado: (2023)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
por: Zeng, Xingshan, et al.
Publicado: (2025)
por: Zeng, Xingshan, et al.
Publicado: (2025)
Microenvironment Reconstitution‐Induced Collaborative Oxyanions‐Vacancies Engineering for Enhanced High‐Mass‐Loading Energy Storage
por: Mingming Sun, et al.
Publicado: (2024)
por: Mingming Sun, et al.
Publicado: (2024)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
por: Li, Jia, et al.
Publicado: (2026)
por: Li, Jia, et al.
Publicado: (2026)
Does the Generator Mind its Contexts? An Analysis of Generative Model Faithfulness under Context Transfer
por: Hu, Xinshuo, et al.
Publicado: (2024)
por: Hu, Xinshuo, et al.
Publicado: (2024)
ToolFlow: Boosting LLM Tool-Calling Through Natural and Coherent Dialogue Synthesis
por: Wang, Zezhong, et al.
Publicado: (2024)
por: Wang, Zezhong, et al.
Publicado: (2024)
The Kähler submanifolds between the ball bundles and the complex Euclidean space
por: Chen, Mingming, et al.
Publicado: (2026)
por: Chen, Mingming, et al.
Publicado: (2026)
On the negatively pinched properties of the disc bundles over negatively pinched Kähler manifolds
por: Hao, Yihong, et al.
Publicado: (2025)
por: Hao, Yihong, et al.
Publicado: (2025)
The Power of Personality: A Human Simulation Perspective to Investigate Large Language Model Agents
por: Duan, Yifan, et al.
Publicado: (2025)
por: Duan, Yifan, et al.
Publicado: (2025)
Real‐World Clinical Practices for Premature Ejaculation: A National Survey of Chinese Physicians
por: Jun Zhu, et al.
Publicado: (2026)
por: Jun Zhu, et al.
Publicado: (2026)
Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey
por: Qu, Bingzheng, et al.
Publicado: (2026)
por: Qu, Bingzheng, et al.
Publicado: (2026)
Evaluating the External and Parametric Knowledge Fusion of Large Language Models
por: Zhang, Hao, et al.
Publicado: (2024)
por: Zhang, Hao, et al.
Publicado: (2024)
On the Hallucination in Simultaneous Machine Translation
por: Zhong, Meizhi, et al.
Publicado: (2024)
por: Zhong, Meizhi, et al.
Publicado: (2024)
FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
por: Jiang, Yuxin, et al.
Publicado: (2023)
por: Jiang, Yuxin, et al.
Publicado: (2023)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
por: Kwan, Wai-Chung, et al.
Publicado: (2024)
por: Kwan, Wai-Chung, et al.
Publicado: (2024)
Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization
por: Jiang, Yuxin, et al.
Publicado: (2024)
por: Jiang, Yuxin, et al.
Publicado: (2024)
AddressCLIP: Empowering Vision-Language Models for City-wide Image Address Localization
por: Xu, Shixiong, et al.
Publicado: (2024)
por: Xu, Shixiong, et al.
Publicado: (2024)
Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
por: Wang, Zezhong, et al.
Publicado: (2025)
por: Wang, Zezhong, et al.
Publicado: (2025)
Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-Step
por: Wang, Zezhong, et al.
Publicado: (2024)
por: Wang, Zezhong, et al.
Publicado: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
Mechanistic Insights into the Dissolution Relay for Deep Progression of Active Sites Toward Efficient and Ultralong‐Life Energy Storage
por: Mingming Sun, et al.
Publicado: (2025)
por: Mingming Sun, et al.
Publicado: (2025)
Mechanistic Insights into the Dissolution Relay for Deep Progression of Active Sites Toward Efficient and Ultralong‐Life Energy Storage
por: Mingming Sun, et al.
Publicado: (2025)
por: Mingming Sun, et al.
Publicado: (2025)
Retrieval-based Disentangled Representation Learning with Natural Language Supervision
por: Zhou, Jiawei, et al.
Publicado: (2022)
por: Zhou, Jiawei, et al.
Publicado: (2022)
ContractTinker: LLM-Empowered Vulnerability Repair for Real-World Smart Contracts
por: Wang, Che, et al.
Publicado: (2024)
por: Wang, Che, et al.
Publicado: (2024)
Thinking in Character: Advancing Role-Playing Agents with Role-Aware Reasoning
por: Tang, Yihong, et al.
Publicado: (2025)
por: Tang, Yihong, et al.
Publicado: (2025)
The Rise of Darkness: Safety-Utility Trade-Offs in Role-Playing Dialogue Agents
por: Tang, Yihong, et al.
Publicado: (2025)
por: Tang, Yihong, et al.
Publicado: (2025)
Character-R1: Enhancing Role-Aware Reasoning in Role-Playing Agents via RLVR
por: Tang, Yihong, et al.
Publicado: (2026)
por: Tang, Yihong, et al.
Publicado: (2026)
Submicrobial Dosing of Antibiotics in Dermatology: A Survey of Real World Practice Patterns
por: Henry Zou, et al.
Publicado: (2025)
por: Henry Zou, et al.
Publicado: (2025)
ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning
por: Zeng, Xingshan, et al.
Publicado: (2025)
por: Zeng, Xingshan, et al.
Publicado: (2025)
Ejemplares similares
-
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
por: Zhao, Wenshuo, et al.
Publicado: (2026) -
Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios
por: Huang, Shijue, et al.
Publicado: (2024) -
Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent
por: Tang, Yihong, et al.
Publicado: (2026) -
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
por: Jiang, Yuxin, et al.
Publicado: (2026) -
Position: The Real Barrier to LLM Agent Usability is Agentic ROI
por: Liu, Weiwen, et al.
Publicado: (2025)