Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Zhiyuan, Xiong, Shiyun, Zhang, Yifan, Ng, See-Kiong, Luu, Anh Tuan, An, Bo, Yan, Shuicheng, Hooi, Bryan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs
por: Hu, Zhiyuan, et al.
Publicado: (2026)
por: Hu, Zhiyuan, et al.
Publicado: (2026)
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
por: Zhao, James Xu, et al.
Publicado: (2025)
por: Zhao, James Xu, et al.
Publicado: (2025)
Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning
por: Hu, Zhiyuan, et al.
Publicado: (2026)
por: Hu, Zhiyuan, et al.
Publicado: (2026)
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models
por: Cao, Tri, et al.
Publicado: (2026)
por: Cao, Tri, et al.
Publicado: (2026)
Uncertainty of Thoughts: Uncertainty-Aware Planning Enhances Information Seeking in Large Language Models
por: Hu, Zhiyuan, et al.
Publicado: (2024)
por: Hu, Zhiyuan, et al.
Publicado: (2024)
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
por: Nguyen, Thong, et al.
Publicado: (2025)
por: Nguyen, Thong, et al.
Publicado: (2025)
LongRecipe: Recipe for Efficient Long Context Generalization in Large Language Models
por: Hu, Zhiyuan, et al.
Publicado: (2024)
por: Hu, Zhiyuan, et al.
Publicado: (2024)
Spatio-Temporal Foundation Models: Vision, Challenges, and Opportunities
por: Goodge, Adam, et al.
Publicado: (2025)
por: Goodge, Adam, et al.
Publicado: (2025)
Encoding and Controlling Global Semantics for Long-form Video Question Answering
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
por: Du, Mingzhe, et al.
Publicado: (2024)
por: Du, Mingzhe, et al.
Publicado: (2024)
SemRoDe: Macro Adversarial Training to Learn Representations That are Robust to Word-Level Attacks
por: Formento, Brian, et al.
Publicado: (2024)
por: Formento, Brian, et al.
Publicado: (2024)
Vision-and-Language Pretraining
por: Nguyen, Thong, et al.
Publicado: (2022)
por: Nguyen, Thong, et al.
Publicado: (2022)
Multi-Scale Contrastive Learning for Video Temporal Grounding
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift
por: Le, Khoi, et al.
Publicado: (2026)
por: Le, Khoi, et al.
Publicado: (2026)
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
por: Nguyen, Thong, et al.
Publicado: (2023)
por: Nguyen, Thong, et al.
Publicado: (2023)
GUI-PRA: Process Reward Agent for GUI Tasks
por: Xiong, Tao, et al.
Publicado: (2025)
por: Xiong, Tao, et al.
Publicado: (2025)
Inference-Time Attribute Distribution Alignment for Unconditional Diffusion
por: Luan, Hao, et al.
Publicado: (2026)
por: Luan, Hao, et al.
Publicado: (2026)
How Does Response Length Affect Long-Form Factuality
por: Zhao, James Xu, et al.
Publicado: (2025)
por: Zhao, James Xu, et al.
Publicado: (2025)
DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding
por: Nguyen, Thong, et al.
Publicado: (2023)
por: Nguyen, Thong, et al.
Publicado: (2023)
Topic Modeling as Multi-Objective Contrastive Optimization
por: Nguyen, Thong, et al.
Publicado: (2024)
por: Nguyen, Thong, et al.
Publicado: (2024)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
por: Wu, Tianyi, et al.
Publicado: (2025)
por: Wu, Tianyi, et al.
Publicado: (2025)
Motion-aware Contrastive Learning for Temporal Panoptic Scene Graph Generation
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
MAMA: Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation Learning
por: Nguyen, Thong, et al.
Publicado: (2024)
por: Nguyen, Thong, et al.
Publicado: (2024)
Paper Espresso: From Paper Overload to Research Insight
por: Du, Mingzhe, et al.
Publicado: (2026)
por: Du, Mingzhe, et al.
Publicado: (2026)
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
por: Fu, Jinlan, et al.
Publicado: (2025)
por: Fu, Jinlan, et al.
Publicado: (2025)
CodeArena: A Collective Evaluation Platform for LLM Code Generation
por: Du, Mingzhe, et al.
Publicado: (2025)
por: Du, Mingzhe, et al.
Publicado: (2025)
Hint-before-Solving Prompting: Guiding LLMs to Effectively Utilize Encoded Knowledge
por: Fu, Jinlan, et al.
Publicado: (2024)
por: Fu, Jinlan, et al.
Publicado: (2024)
Balancing Truthfulness and Informativeness with Uncertainty-Aware Instruction Fine-Tuning
por: Wu, Tianyi, et al.
Publicado: (2025)
por: Wu, Tianyi, et al.
Publicado: (2025)
Mem-W: Latent Memory-Native GUI Agents
por: Zhang, Guibin, et al.
Publicado: (2026)
por: Zhang, Guibin, et al.
Publicado: (2026)
Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning
por: Liu, Renyang, et al.
Publicado: (2025)
por: Liu, Renyang, et al.
Publicado: (2025)
Unsupervised Hallucination Detection by Inspecting Reasoning Processes
por: Srey, Ponhvoan, et al.
Publicado: (2025)
por: Srey, Ponhvoan, et al.
Publicado: (2025)
Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives
por: Nguyen, Thong, et al.
Publicado: (2024)
por: Nguyen, Thong, et al.
Publicado: (2024)
TRACE: TRansformer-based Attribution using Contrastive Embeddings in LLMs
por: Wang, Cheng, et al.
Publicado: (2024)
por: Wang, Cheng, et al.
Publicado: (2024)
Multi-Agent Sampling: Scaling Inference Compute for Data Synthesis with Tree Search-Based Agentic Collaboration
por: Ye, Hai, et al.
Publicado: (2024)
por: Ye, Hai, et al.
Publicado: (2024)
MAgIC: Investigation of Large Language Model Powered Multi-Agent in Cognition, Adaptability, Rationality and Collaboration
por: Xu, Lin, et al.
Publicado: (2023)
por: Xu, Lin, et al.
Publicado: (2023)
MASim: Multilingual Agent-Based Simulation for Social Science
por: Zhang, Xuan, et al.
Publicado: (2025)
por: Zhang, Xuan, et al.
Publicado: (2025)
AgentStudio: A Toolkit for Building General Virtual Agents
por: Zheng, Longtao, et al.
Publicado: (2024)
por: Zheng, Longtao, et al.
Publicado: (2024)
Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models
por: Shu, Yao, et al.
Publicado: (2024)
por: Shu, Yao, et al.
Publicado: (2024)
Projected Coupled Diffusion for Test-Time Constrained Joint Generation
por: Luan, Hao, et al.
Publicado: (2025)
por: Luan, Hao, et al.
Publicado: (2025)
Confidence Elicitation: A New Attack Vector for Large Language Models
por: Formento, Brian, et al.
Publicado: (2025)
por: Formento, Brian, et al.
Publicado: (2025)
Ejemplares similares
-
Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs
por: Hu, Zhiyuan, et al.
Publicado: (2026) -
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
por: Zhao, James Xu, et al.
Publicado: (2025) -
Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning
por: Hu, Zhiyuan, et al.
Publicado: (2026) -
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models
por: Cao, Tri, et al.
Publicado: (2026) -
Uncertainty of Thoughts: Uncertainty-Aware Planning Enhances Information Seeking in Large Language Models
por: Hu, Zhiyuan, et al.
Publicado: (2024)