COMPASS: Benchmarking Constrained Optimization in LLM Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Qin, Tian, Bai, Felix, Hu, Ting-Yao, Vemulapalli, Raviteja, Koppula, Hema Swetha, Xu, Zhiyang, Jin, Bowen, Cemri, Mert, Lu, Jiarui, Wang, Zirui, Cao, Meng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning from Self Critique and Refinement for Faithful LLM Summarization
di: Hu, Ting-Yao, et al.
Pubblicazione: (2025)
di: Hu, Ting-Yao, et al.
Pubblicazione: (2025)
Mutual Reinforcement of LLM Dialogue Synthesis and Summarization Capabilities for Few-Shot Dialogue Summarization
di: Lu, Yen-Ju, et al.
Pubblicazione: (2025)
di: Lu, Yen-Ju, et al.
Pubblicazione: (2025)
Learning to Reason for Hallucination Span Detection
di: Su, Hsuan, et al.
Pubblicazione: (2025)
di: Su, Hsuan, et al.
Pubblicazione: (2025)
Controlling Performance and Budget of a Centralized Multi-agent LLM System with Reinforcement Learning
di: Jin, Bowen, et al.
Pubblicazione: (2025)
di: Jin, Bowen, et al.
Pubblicazione: (2025)
MUSCLE: A Model Update Strategy for Compatible LLM Evolution
di: Echterhoff, Jessica, et al.
Pubblicazione: (2024)
di: Echterhoff, Jessica, et al.
Pubblicazione: (2024)
DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning
di: Bai, Hao, et al.
Pubblicazione: (2024)
di: Bai, Hao, et al.
Pubblicazione: (2024)
ASTRA-bench: Evaluating Tool-Use Agent Reasoning and Action Planning with Personal User Context
di: Xiu, Zidi, et al.
Pubblicazione: (2026)
di: Xiu, Zidi, et al.
Pubblicazione: (2026)
Synth4Seg -- Learning Defect Data Synthesis for Defect Segmentation using Bi-level Optimization
di: Mou, Shancong, et al.
Pubblicazione: (2024)
di: Mou, Shancong, et al.
Pubblicazione: (2024)
TiC-LM: A Web-Scale Benchmark for Time-Continual LLM Pretraining
di: Li, Jeffrey, et al.
Pubblicazione: (2025)
di: Li, Jeffrey, et al.
Pubblicazione: (2025)
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2023)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2023)
LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis
di: Qin, Bowen
Pubblicazione: (2026)
di: Qin, Bowen
Pubblicazione: (2026)
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
di: Xu, Zhiyang, et al.
Pubblicazione: (2026)
di: Xu, Zhiyang, et al.
Pubblicazione: (2026)
AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization
di: Cemri, Mert, et al.
Pubblicazione: (2026)
di: Cemri, Mert, et al.
Pubblicazione: (2026)
ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities
di: Lu, Jiarui, et al.
Pubblicazione: (2024)
di: Lu, Jiarui, et al.
Pubblicazione: (2024)
Scarecrow‐Shaped Antenna Optimization Using Machine Learning Algorithms
di: S. Bhavani, et al.
Pubblicazione: (2025)
di: S. Bhavani, et al.
Pubblicazione: (2025)
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
di: Vemulapalli, Raviteja, et al.
Pubblicazione: (2023)
di: Vemulapalli, Raviteja, et al.
Pubblicazione: (2023)
Why Do Multi-Agent LLM Systems Fail?
di: Cemri, Mert, et al.
Pubblicazione: (2025)
di: Cemri, Mert, et al.
Pubblicazione: (2025)
Bounds on Successive Minima of Orders in Number Fields and Scrollar Invariants of Curves
di: Vemulapalli, Sameera
Pubblicazione: (2022)
di: Vemulapalli, Sameera
Pubblicazione: (2022)
The distribution of lattices arising from orders in low degree number fields
di: Vemulapalli, Sameera
Pubblicazione: (2024)
di: Vemulapalli, Sameera
Pubblicazione: (2024)
The Steinitz Realization Problem
di: Vemulapalli, Sameera
Pubblicazione: (2024)
di: Vemulapalli, Sameera
Pubblicazione: (2024)
The Role of GDPs in Oral Surgery Delivery
di: Vidwat Vemulapalli
Pubblicazione: (2025)
di: Vidwat Vemulapalli
Pubblicazione: (2025)
Evaluating Pulsed Field Ablation for Atrial Fibrillation: A Systematic Review and Meta‐Analysis of Procedural Outcomes
di: Poojan Prajapati, et al.
Pubblicazione: (2025)
di: Poojan Prajapati, et al.
Pubblicazione: (2025)
AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
Learning Safely Without Knowing the World:COMPASS-Hedge
di: Hu, Ting, et al.
Pubblicazione: (2026)
di: Hu, Ting, et al.
Pubblicazione: (2026)
Intelligent cloud networking: Applying ai and reinforcement learning for dynamic traffic engineering, QoS optimization and threat detection in software-defined cloud architectures
di: Guntupalli, Raviteja
Pubblicazione: (2025)
di: Guntupalli, Raviteja
Pubblicazione: (2025)
Evolution of Panchayati Raj System in India with Special Reference to Telangana: Issues and Challenges
di: Mallesham, Koppula, et al.
Pubblicazione: (2025)
di: Mallesham, Koppula, et al.
Pubblicazione: (2025)
COMPASS: Enhancing Agent Long-Horizon Reasoning with Evolving Context
di: Wan, Guangya, et al.
Pubblicazione: (2025)
di: Wan, Guangya, et al.
Pubblicazione: (2025)
TiC-CLIP: Continual Training of CLIP Models
di: Garg, Saurabh, et al.
Pubblicazione: (2023)
di: Garg, Saurabh, et al.
Pubblicazione: (2023)
CAMPHOR: Collaborative Agents for Multi-input Planning and High-Order Reasoning On Device
di: Fu, Yicheng, et al.
Pubblicazione: (2024)
di: Fu, Yicheng, et al.
Pubblicazione: (2024)
CatMemo at the FinLLM Challenge Task: Fine-Tuning Large Language Models using Data Fusion in Financial Applications
di: Cao, Yupeng, et al.
Pubblicazione: (2024)
di: Cao, Yupeng, et al.
Pubblicazione: (2024)
Synthesis of Imidazo[1,2‐ a ]pyridine‐Isoquinoline Derivatives as Potent EGFR Inhibiting Anticancer Agents
di: Mahendar Reddy Gunuguntla, et al.
Pubblicazione: (2024)
di: Mahendar Reddy Gunuguntla, et al.
Pubblicazione: (2024)
Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Rationale-Augmented Retrieval with Constrained LLM Re-Ranking for Task Discovery
di: Wei, Bowen
Pubblicazione: (2025)
di: Wei, Bowen
Pubblicazione: (2025)
COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents
di: Shen, Wenkai, et al.
Pubblicazione: (2026)
di: Shen, Wenkai, et al.
Pubblicazione: (2026)
An Accelerated Primal Dual Algorithm with Backtracking for Decentralized Constrained Optimization
di: Xu, Qiushui, et al.
Pubblicazione: (2025)
di: Xu, Qiushui, et al.
Pubblicazione: (2025)
Descent-Net: Learning Descent Directions for Constrained Optimization
di: Zhou, Zisheng, et al.
Pubblicazione: (2025)
di: Zhou, Zisheng, et al.
Pubblicazione: (2025)
LangDA: Building Context-Awareness via Language for Domain Adaptive Semantic Segmentation
di: Liu, Chang, et al.
Pubblicazione: (2025)
di: Liu, Chang, et al.
Pubblicazione: (2025)
Effect of container size and types on the root phenotypic characters of Capsicum
di: M.S.V. Raviteja
Pubblicazione: (2021)
di: M.S.V. Raviteja
Pubblicazione: (2021)
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
di: Si, Wenwen, et al.
Pubblicazione: (2025)
di: Si, Wenwen, et al.
Pubblicazione: (2025)
AgentLAB: Benchmarking LLM Agents against Long-Horizon Attacks
di: Jiang, Tanqiu, et al.
Pubblicazione: (2026)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Learning from Self Critique and Refinement for Faithful LLM Summarization
di: Hu, Ting-Yao, et al.
Pubblicazione: (2025) -
Mutual Reinforcement of LLM Dialogue Synthesis and Summarization Capabilities for Few-Shot Dialogue Summarization
di: Lu, Yen-Ju, et al.
Pubblicazione: (2025) -
Learning to Reason for Hallucination Span Detection
di: Su, Hsuan, et al.
Pubblicazione: (2025) -
Controlling Performance and Budget of a Centralized Multi-agent LLM System with Reinforcement Learning
di: Jin, Bowen, et al.
Pubblicazione: (2025) -
MUSCLE: A Model Update Strategy for Compatible LLM Evolution
di: Echterhoff, Jessica, et al.
Pubblicazione: (2024)