Salvato in:
| Autori principali: | Wang, Qingni, Fan, Yue, Wang, Xin Eric |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.02419 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation
di: Han, Qijun, et al.
Pubblicazione: (2026)
di: Han, Qijun, et al.
Pubblicazione: (2026)
You Don't Know Until You Click:Automated GUI Testing for Production-Ready Software Evaluation
di: Bian, Yutong, et al.
Pubblicazione: (2025)
di: Bian, Yutong, et al.
Pubblicazione: (2025)
Building Trust in the Skies: A Knowledge-Grounded LLM-based Framework for Aviation Safety
di: Iyengar, Anirudh, et al.
Pubblicazione: (2026)
di: Iyengar, Anirudh, et al.
Pubblicazione: (2026)
Localized Calibrated Uncertainty in Code Language Models
di: Gros, David, et al.
Pubblicazione: (2025)
di: Gros, David, et al.
Pubblicazione: (2025)
Zero-Permission Manipulation: Can We Trust Large Multimodal Model Powered GUI Agents?
di: Qian, Yi, et al.
Pubblicazione: (2026)
di: Qian, Yi, et al.
Pubblicazione: (2026)
BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models
di: Li, Yuanhao, et al.
Pubblicazione: (2026)
di: Li, Yuanhao, et al.
Pubblicazione: (2026)
From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation
di: Yang, Guang, et al.
Pubblicazione: (2026)
di: Yang, Guang, et al.
Pubblicazione: (2026)
Agentic Scientific Simulation: Execution-Grounded Model Construction and Reconstruction
di: Lie, Knut-Andreas, et al.
Pubblicazione: (2026)
di: Lie, Knut-Andreas, et al.
Pubblicazione: (2026)
AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration
di: Wang, Ruiqi, et al.
Pubblicazione: (2025)
di: Wang, Ruiqi, et al.
Pubblicazione: (2025)
When Safe Skills Collide: Measuring Compositional Risk in Agent Skill Ecosystems
di: Wang, Su, et al.
Pubblicazione: (2026)
di: Wang, Su, et al.
Pubblicazione: (2026)
Grammars of Formal Uncertainty: When to Trust LLMs in Automated Reasoning Tasks
di: Ganguly, Debargha, et al.
Pubblicazione: (2025)
di: Ganguly, Debargha, et al.
Pubblicazione: (2025)
Precision in Practice: Knowledge Guided Code Summarizing Grounded in Industrial Expectations
di: Li, Jintai, et al.
Pubblicazione: (2026)
di: Li, Jintai, et al.
Pubblicazione: (2026)
GAN-enhanced Simulation-driven DNN Testing in Absence of Ground Truth
di: Attaoui, Mohammed, et al.
Pubblicazione: (2025)
di: Attaoui, Mohammed, et al.
Pubblicazione: (2025)
Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement
di: Hayashi, Hiroaki, et al.
Pubblicazione: (2025)
di: Hayashi, Hiroaki, et al.
Pubblicazione: (2025)
DrugPlayGround: Benchmarking Large Language Models and Embeddings for Drug Discovery
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
Model Provenance via Model DNA
di: Mu, Xin, et al.
Pubblicazione: (2023)
di: Mu, Xin, et al.
Pubblicazione: (2023)
Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents
di: Tse-Hsun, et al.
Pubblicazione: (2026)
di: Tse-Hsun, et al.
Pubblicazione: (2026)
Comment and Control: Hijacking Agentic Workflows via Context-Grounded Evolution
di: Fendley, Neil, et al.
Pubblicazione: (2026)
di: Fendley, Neil, et al.
Pubblicazione: (2026)
Enhancing Code Generation via Bidirectional Comment-Level Mutual Grounding
di: Di, Yifeng, et al.
Pubblicazione: (2025)
di: Di, Yifeng, et al.
Pubblicazione: (2025)
AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering
di: Kumar, Rajesh, et al.
Pubblicazione: (2026)
di: Kumar, Rajesh, et al.
Pubblicazione: (2026)
REGAL: A Registry-Driven Architecture for Deterministic Grounding of Agentic AI in Enterprise Telemetry
di: Agrawal, Yuvraj
Pubblicazione: (2026)
di: Agrawal, Yuvraj
Pubblicazione: (2026)
InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation
di: Chen, Qiaosheng, et al.
Pubblicazione: (2025)
di: Chen, Qiaosheng, et al.
Pubblicazione: (2025)
GeoContra: From Fluent GIS Code to Verifiable Spatial Analysis with Geography-Grounded Repair
di: Xiao, Yinhao, et al.
Pubblicazione: (2026)
di: Xiao, Yinhao, et al.
Pubblicazione: (2026)
GUITestScape: Towards Open-set Evaluation on Exploratory GUI Testing
di: Chen, Xiaoyi, et al.
Pubblicazione: (2026)
di: Chen, Xiaoyi, et al.
Pubblicazione: (2026)
DiagEval: Trajectory-Conditioned Diagnosis for Reliable Software Evaluation with GUI Agents
di: Hong, Sirui, et al.
Pubblicazione: (2026)
di: Hong, Sirui, et al.
Pubblicazione: (2026)
Spec Kit Agents: Context-Grounded Agentic Workflows
di: Taghavi, Pardis, et al.
Pubblicazione: (2026)
di: Taghavi, Pardis, et al.
Pubblicazione: (2026)
Fragmented Layer Grouping in GUI Designs Through Graph Learning Based on Multimodal Information
di: Chen, Yunnong, et al.
Pubblicazione: (2024)
di: Chen, Yunnong, et al.
Pubblicazione: (2024)
AndroidControl-Curated: Revealing the True Potential of GUI Agents through Benchmark Purification
di: Leung, Ho Fai, et al.
Pubblicazione: (2025)
di: Leung, Ho Fai, et al.
Pubblicazione: (2025)
Trust Calibration in IDEs: Paving the Way for Widespread Adoption of AI Refactoring
di: Borg, Markus
Pubblicazione: (2024)
di: Borg, Markus
Pubblicazione: (2024)
When Neural Code Completion Models Size up the Situation: Attaining Cheaper and Faster Completion through Dynamic Model Inference
di: Sun, Zhensu, et al.
Pubblicazione: (2024)
di: Sun, Zhensu, et al.
Pubblicazione: (2024)
Workflow for Safe-AI
di: Veljanovska, Suzana, et al.
Pubblicazione: (2025)
di: Veljanovska, Suzana, et al.
Pubblicazione: (2025)
Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
di: Jiang, Shan, et al.
Pubblicazione: (2026)
di: Jiang, Shan, et al.
Pubblicazione: (2026)
Large Language Models in Code Co-generation for Safe Autonomous Vehicles
di: Nouri, Ali, et al.
Pubblicazione: (2025)
di: Nouri, Ali, et al.
Pubblicazione: (2025)
InfraMind: A Novel Exploration-based GUI Agentic Framework for Mission-critical Industrial Management
di: Lin, Liangtao, et al.
Pubblicazione: (2025)
di: Lin, Liangtao, et al.
Pubblicazione: (2025)
Does In-IDE Calibration of Large Language Models work at Scale?
di: Koohestani, Roham, et al.
Pubblicazione: (2025)
di: Koohestani, Roham, et al.
Pubblicazione: (2025)
Beyond Trusting Trust: Multi-Model Validation for Robust Code Generation
di: McDanel, Bradley
Pubblicazione: (2025)
di: McDanel, Bradley
Pubblicazione: (2025)
LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs
di: Zhou, Zenghui, et al.
Pubblicazione: (2026)
di: Zhou, Zenghui, et al.
Pubblicazione: (2026)
When Fuzzing Meets LLMs: Challenges and Opportunities
di: Jiang, Yu, et al.
Pubblicazione: (2024)
di: Jiang, Yu, et al.
Pubblicazione: (2024)
Agentic AI Software Engineers: Programming with Trust
di: Roychoudhury, Abhik, et al.
Pubblicazione: (2025)
di: Roychoudhury, Abhik, et al.
Pubblicazione: (2025)
Chain of Grounded Objectives: Bridging Process and Goal-oriented Prompting for Code Generation
di: Yeo, Sangyeop, et al.
Pubblicazione: (2025)
di: Yeo, Sangyeop, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation
di: Han, Qijun, et al.
Pubblicazione: (2026) -
You Don't Know Until You Click:Automated GUI Testing for Production-Ready Software Evaluation
di: Bian, Yutong, et al.
Pubblicazione: (2025) -
Building Trust in the Skies: A Knowledge-Grounded LLM-based Framework for Aviation Safety
di: Iyengar, Anirudh, et al.
Pubblicazione: (2026) -
Localized Calibrated Uncertainty in Code Language Models
di: Gros, David, et al.
Pubblicazione: (2025) -
Zero-Permission Manipulation: Can We Trust Large Multimodal Model Powered GUI Agents?
di: Qian, Yi, et al.
Pubblicazione: (2026)