ANCHOR: Branch-Point Data Generation for GUI Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Wei, Jinbiao, Zhao, Yilun, Ni, Kangqi, Cohan, Arman |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Step-level Optimization for Efficient Computer-use Agents
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
OpenComputer: Verifiable Software Worlds for Computer-Use Agents
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
di: Liu, Hongjun, et al.
Pubblicazione: (2025)
di: Liu, Hongjun, et al.
Pubblicazione: (2025)
Investigating Data Contamination in Modern Benchmarks for Large Language Models
di: Deng, Chunyuan, et al.
Pubblicazione: (2023)
di: Deng, Chunyuan, et al.
Pubblicazione: (2023)
ResearchGym: Evaluating Language Model Agents on Real-World AI Research
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2026)
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2026)
RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation
di: Wu, Sihong, et al.
Pubblicazione: (2026)
di: Wu, Sihong, et al.
Pubblicazione: (2026)
PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem Solving
di: Feng, Kaiyue, et al.
Pubblicazione: (2025)
di: Feng, Kaiyue, et al.
Pubblicazione: (2025)
MIMIR: A Streamlined Platform for Personalized Agent Tuning in Domain Expertise
di: Deng, Chunyuan, et al.
Pubblicazione: (2024)
di: Deng, Chunyuan, et al.
Pubblicazione: (2024)
MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
di: Li, Chuhan, et al.
Pubblicazione: (2024)
di: Li, Chuhan, et al.
Pubblicazione: (2024)
One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs
di: Dunefsky, Jacob, et al.
Pubblicazione: (2025)
di: Dunefsky, Jacob, et al.
Pubblicazione: (2025)
MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents
di: Im, Youngmin, et al.
Pubblicazione: (2025)
di: Im, Youngmin, et al.
Pubblicazione: (2025)
Survey on Evaluation of LLM-based Agents
di: Yehudai, Asaf, et al.
Pubblicazione: (2025)
di: Yehudai, Asaf, et al.
Pubblicazione: (2025)
Judging with Many Minds: Do More Perspectives Mean Less Prejudice? On Bias Amplifications and Resistance in Multi-Agent Based LLM-as-Judge
di: Ma, Chiyu, et al.
Pubblicazione: (2025)
di: Ma, Chiyu, et al.
Pubblicazione: (2025)
SciMDR: Advancing Scientific Multimodal Document Reasoning
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
di: Yang, Tianyu, et al.
Pubblicazione: (2026)
di: Yang, Tianyu, et al.
Pubblicazione: (2026)
On the Benefits of Fine-Grained Loss Truncation: A Case Study on Factuality in Summarization
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2024)
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2024)
GUI-PRA: Process Reward Agent for GUI Tasks
di: Xiong, Tao, et al.
Pubblicazione: (2025)
di: Xiong, Tao, et al.
Pubblicazione: (2025)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future
di: Wu, Sihong, et al.
Pubblicazione: (2026)
di: Wu, Sihong, et al.
Pubblicazione: (2026)
AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
di: Liu, Yixin, et al.
Pubblicazione: (2025)
di: Liu, Yixin, et al.
Pubblicazione: (2025)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
di: Shangguan, Ziyao, et al.
Pubblicazione: (2024)
di: Shangguan, Ziyao, et al.
Pubblicazione: (2024)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
di: Zhao, Kangjia, et al.
Pubblicazione: (2024)
di: Zhao, Kangjia, et al.
Pubblicazione: (2024)
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
di: Long, Yitao, et al.
Pubblicazione: (2025)
di: Long, Yitao, et al.
Pubblicazione: (2025)
AUTO-Explorer: Automated Data Collection for GUI Agent
di: Guo, Xiangwu, et al.
Pubblicazione: (2025)
di: Guo, Xiangwu, et al.
Pubblicazione: (2025)
ChemAgent: Self-updating Library in Large Language Models Improves Chemical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
Learning with Challenges: Adaptive Difficulty-Aware Data Generation for Mobile GUI Agent Training
di: Kang, Linjia, et al.
Pubblicazione: (2026)
di: Kang, Linjia, et al.
Pubblicazione: (2026)
Step-Back Profiling: Distilling User History for Personalized Scientific Writing
di: Tang, Xiangru, et al.
Pubblicazione: (2024)
di: Tang, Xiangru, et al.
Pubblicazione: (2024)
Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
di: Zhao, Yilun, et al.
Pubblicazione: (2026)
di: Zhao, Yilun, et al.
Pubblicazione: (2026)
Bayesian Calibration of Win Rate Estimation with LLM Evaluators
di: Gao, Yicheng, et al.
Pubblicazione: (2024)
di: Gao, Yicheng, et al.
Pubblicazione: (2024)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
di: Gao, Longxi, et al.
Pubblicazione: (2025)
di: Gao, Longxi, et al.
Pubblicazione: (2025)
BEAP-Agent: Backtrackable Execution and Adaptive Planning for GUI Agents
di: Lu, Ziyu, et al.
Pubblicazione: (2026)
di: Lu, Ziyu, et al.
Pubblicazione: (2026)
Calibrating Long-form Generations from Large Language Models
di: Huang, Yukun, et al.
Pubblicazione: (2024)
di: Huang, Yukun, et al.
Pubblicazione: (2024)
GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents
di: Chen, Chen, et al.
Pubblicazione: (2026)
di: Chen, Chen, et al.
Pubblicazione: (2026)
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
di: Chen, Ruihan, et al.
Pubblicazione: (2025)
di: Chen, Ruihan, et al.
Pubblicazione: (2025)
MobileDreamer: Generative Sketch World Model for GUI Agent
di: Cao, Yilin, et al.
Pubblicazione: (2026)
di: Cao, Yilin, et al.
Pubblicazione: (2026)
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
di: Li, Runze, et al.
Pubblicazione: (2025)
di: Li, Runze, et al.
Pubblicazione: (2025)
REVERE: Reflective Evolving Research Engineer for Scientific Workflows
di: Gangireddi, Balaji Dinesh, et al.
Pubblicazione: (2026)
di: Gangireddi, Balaji Dinesh, et al.
Pubblicazione: (2026)
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
di: Xie, Bin, et al.
Pubblicazione: (2025)
di: Xie, Bin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Step-level Optimization for Efficient Computer-use Agents
di: Wei, Jinbiao, et al.
Pubblicazione: (2026) -
OpenComputer: Verifiable Software Worlds for Computer-Use Agents
di: Wei, Jinbiao, et al.
Pubblicazione: (2026) -
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
di: Liu, Hongjun, et al.
Pubblicazione: (2025) -
Investigating Data Contamination in Modern Benchmarks for Large Language Models
di: Deng, Chunyuan, et al.
Pubblicazione: (2023) -
ResearchGym: Evaluating Language Model Agents on Real-World AI Research
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2026)