AgentSPEX: An Agent SPecification and EXecution Language
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Pengcheng, Huang, Jerry, Yao, Jiarui, Pan, Rui, Niu, Peizhi, Liu, Yaowenqi, Wang, Ruida, Lu, Renhao, Guo, Yuwei, Zhang, Tong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FANS -- Formal Answer Selection for Natural Language Math Reasoning Using Lean4
par: Yao, Jiarui, et autres
Publié: (2025)
par: Yao, Jiarui, et autres
Publié: (2025)
Active Prompting with Chain-of-Thought for Large Language Models
par: Diao, Shizhe, et autres
Publié: (2023)
par: Diao, Shizhe, et autres
Publié: (2023)
PhysProver: Advancing Automatic Theorem Proving for Physics
par: Zhang, Hanning, et autres
Publié: (2026)
par: Zhang, Hanning, et autres
Publié: (2026)
GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving
par: Wang, Ruida, et autres
Publié: (2025)
par: Wang, Ruida, et autres
Publié: (2025)
Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents
par: Al-Tawaha, Ahmad, et autres
Publié: (2026)
par: Al-Tawaha, Ahmad, et autres
Publié: (2026)
SPEX: Scaling Feature Interaction Explanations for LLMs
par: Kang, Justin Singh, et autres
Publié: (2025)
par: Kang, Justin Singh, et autres
Publié: (2025)
Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling
par: Kuang, Peng, et autres
Publié: (2025)
par: Kuang, Peng, et autres
Publié: (2025)
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
par: Wang, Xinchen, et autres
Publié: (2025)
par: Wang, Xinchen, et autres
Publié: (2025)
GUIDE: Towards Scalable Advising for Research Ideas
par: Liu, Yaowenqi, et autres
Publié: (2025)
par: Liu, Yaowenqi, et autres
Publié: (2025)
AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research Agents
par: Jin, Jiarui, et autres
Publié: (2026)
par: Jin, Jiarui, et autres
Publié: (2026)
FLEX: Expert-level False-Less EXecution Metric for Reliable Text-to-SQL Benchmark
par: Kim, Heegyu, et autres
Publié: (2024)
par: Kim, Heegyu, et autres
Publié: (2024)
HiMATE: A Hierarchical Multi-Agent Framework for Machine Translation Evaluation
par: Zhang, Shijie, et autres
Publié: (2025)
par: Zhang, Shijie, et autres
Publié: (2025)
From Correction to Mastery: Reinforced Distillation of Large Language Model Agents
par: Lyu, Yuanjie, et autres
Publié: (2025)
par: Lyu, Yuanjie, et autres
Publié: (2025)
Recursive Multi-Agent Systems
par: Yang, Xiyuan, et autres
Publié: (2026)
par: Yang, Xiyuan, et autres
Publié: (2026)
ProxySPEX: Inference-Efficient Interpretability via Sparse Feature Interactions in LLMs
par: Butler, Landon, et autres
Publié: (2025)
par: Butler, Landon, et autres
Publié: (2025)
Molly: Making Large Language Model Agents Solve Python Problem More Logically
par: Xiao, Rui, et autres
Publié: (2024)
par: Xiao, Rui, et autres
Publié: (2024)
Natural-Language Agent Harnesses
par: Pan, Linyue, et autres
Publié: (2026)
par: Pan, Linyue, et autres
Publié: (2026)
TheoremLlama: Transforming General-Purpose LLMs into Lean4 Experts
par: Wang, Ruida, et autres
Publié: (2024)
par: Wang, Ruida, et autres
Publié: (2024)
Terminal-World: Scaling Terminal-Agent Environments via Agent Skills
par: Cheng, Zihao, et autres
Publié: (2026)
par: Cheng, Zihao, et autres
Publié: (2026)
AgentGym: Evolving Large Language Model-based Agents across Diverse Environments
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
CoEvol: Constructing Better Responses for Instruction Finetuning through Multi-Agent Cooperation
par: Li, Renhao, et autres
Publié: (2024)
par: Li, Renhao, et autres
Publié: (2024)
Code as Agent Harness
par: Ning, Xuying, et autres
Publié: (2026)
par: Ning, Xuying, et autres
Publié: (2026)
Enhancing Dialogue State Tracking Models through LLM-backed User-Agents Simulation
par: Niu, Cheng, et autres
Publié: (2024)
par: Niu, Cheng, et autres
Publié: (2024)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
par: Zhang, Zhexin, et autres
Publié: (2024)
par: Zhang, Zhexin, et autres
Publié: (2024)
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
par: Wang, Ruida, et autres
Publié: (2025)
par: Wang, Ruida, et autres
Publié: (2025)
Chain-of-Experts: Unlocking the Communication Power of Mixture-of-Experts Models
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
KwaiAgents: Generalized Information-seeking Agent System with Large Language Models
par: Pan, Haojie, et autres
Publié: (2023)
par: Pan, Haojie, et autres
Publié: (2023)
Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation
par: Chen, Jiaju, et autres
Publié: (2025)
par: Chen, Jiaju, et autres
Publié: (2025)
DeepAgent: A General Reasoning Agent with Scalable Toolsets
par: Li, Xiaoxi, et autres
Publié: (2025)
par: Li, Xiaoxi, et autres
Publié: (2025)
SRAP-Agent: Simulating and Optimizing Scarce Resource Allocation Policy with LLM-based Agent
par: Ji, Jiarui, et autres
Publié: (2024)
par: Ji, Jiarui, et autres
Publié: (2024)
Structured Agent Distillation for Large Language Model
par: Liu, Jun, et autres
Publié: (2025)
par: Liu, Jun, et autres
Publié: (2025)
Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models
par: Chen, Zehui, et autres
Publié: (2024)
par: Chen, Zehui, et autres
Publié: (2024)
AgentA/B: Automated and Scalable Web A/BTesting with Interactive LLM Agents
par: Lu, Yuxuan, et autres
Publié: (2025)
par: Lu, Yuxuan, et autres
Publié: (2025)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
par: Xu, Huiyu, et autres
Publié: (2024)
par: Xu, Huiyu, et autres
Publié: (2024)
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
par: Shen, Jingyan, et autres
Publié: (2025)
par: Shen, Jingyan, et autres
Publié: (2025)
TDAG: A Multi-Agent Framework based on Dynamic Task Decomposition and Agent Generation
par: Wang, Yaoxiang, et autres
Publié: (2024)
par: Wang, Yaoxiang, et autres
Publié: (2024)
MA-LoT: Model-Collaboration Lean-based Long Chain-of-Thought Reasoning enhances Formal Theorem Proving
par: Wang, Ruida, et autres
Publié: (2025)
par: Wang, Ruida, et autres
Publié: (2025)
Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate
par: Liang, Tian, et autres
Publié: (2023)
par: Liang, Tian, et autres
Publié: (2023)
Debt Collection Negotiations with Large Language Models: An Evaluation System and Optimizing Decision Making with Multi-Agent
par: Wang, Xiaofeng, et autres
Publié: (2025)
par: Wang, Xiaofeng, et autres
Publié: (2025)
MMoA: An AI-Agent framework with recurrence for Memoried Mixure-of-Agent
par: Chu, Rui
Publié: (2026)
par: Chu, Rui
Publié: (2026)
Documents similaires
-
FANS -- Formal Answer Selection for Natural Language Math Reasoning Using Lean4
par: Yao, Jiarui, et autres
Publié: (2025) -
Active Prompting with Chain-of-Thought for Large Language Models
par: Diao, Shizhe, et autres
Publié: (2023) -
PhysProver: Advancing Automatic Theorem Proving for Physics
par: Zhang, Hanning, et autres
Publié: (2026) -
GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving
par: Wang, Ruida, et autres
Publié: (2025) -
Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents
par: Al-Tawaha, Ahmad, et autres
Publié: (2026)