Boosting Virtual Agent Learning and Reasoning: A Step-Wise, Multi-Dimensional, and Generalist Reward Model with Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Miao, Bingchen, Wu, Yang, Gao, Minghe, Yu, Qifan, Bu, Wendong, Zhang, Wenqiao, Li, Yunfei, Tang, Siliang, Chua, Tat-Seng, Li, Juncheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Generalist Virtual Agents: A Survey on Autonomous Agents Across Digital Platforms
par: Gao, Minghe, et autres
Publié: (2024)
par: Gao, Minghe, et autres
Publié: (2024)
What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
par: Bu, Wendong, et autres
Publié: (2025)
par: Bu, Wendong, et autres
Publié: (2025)
Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration
par: Chen, Weile, et autres
Publié: (2026)
par: Chen, Weile, et autres
Publié: (2026)
CORE: Code-based Inverse Self-Training Framework with Graph Expansion for Virtual Agents
par: Wang, Keyu, et autres
Publié: (2026)
par: Wang, Keyu, et autres
Publié: (2026)
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
par: Gao, Minghe, et autres
Publié: (2025)
par: Gao, Minghe, et autres
Publié: (2025)
STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training
par: Qiu, Haiyi, et autres
Publié: (2024)
par: Qiu, Haiyi, et autres
Publié: (2024)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
par: Li, Juncheng, et autres
Publié: (2023)
par: Li, Juncheng, et autres
Publié: (2023)
Fact :Teaching MLLMs with Faithful, Concise and Transferable Rationales
par: Gao, Minghe, et autres
Publié: (2024)
par: Gao, Minghe, et autres
Publié: (2024)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
par: Qin, Bosheng, et autres
Publié: (2023)
par: Qin, Bosheng, et autres
Publié: (2023)
Robust Modality-incomplete Anomaly Detection: A Modality-instructive Framework with Benchmark
par: Miao, Bingchen, et autres
Publié: (2024)
par: Miao, Bingchen, et autres
Publié: (2024)
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
par: Qian, Long, et autres
Publié: (2024)
par: Qian, Long, et autres
Publié: (2024)
OmniMoGen: Unifying Human Motion Generation via Learning from Interleaved Text-Motion Instructions
par: Bu, Wendong, et autres
Publié: (2025)
par: Bu, Wendong, et autres
Publié: (2025)
Mastering Collaborative Multi-modal Data Selection: A Focus on Informativeness, Uniqueness, and Representativeness
par: Yu, Qifan, et autres
Publié: (2024)
par: Yu, Qifan, et autres
Publié: (2024)
SOYO: A Tuning-Free Approach for Video Style Morphing via Style-Adaptive Interpolation in Diffusion Models
par: Zheng, Haoyu, et autres
Publié: (2025)
par: Zheng, Haoyu, et autres
Publié: (2025)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
Auto-Encoding Morph-Tokens for Multimodal LLM
par: Pan, Kaihang, et autres
Publié: (2024)
par: Pan, Kaihang, et autres
Publié: (2024)
Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
par: Ge, Zhiqi, et autres
Publié: (2024)
par: Ge, Zhiqi, et autres
Publié: (2024)
De-fine: Decomposing and Refining Visual Programs with Auto-Feedback
par: Gao, Minghe, et autres
Publié: (2023)
par: Gao, Minghe, et autres
Publié: (2023)
Bridging Local Details and Global Context in Text-Attributed Graphs
par: Wang, Yaoke, et autres
Publié: (2024)
par: Wang, Yaoke, et autres
Publié: (2024)
WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation
par: Chow, Wei, et autres
Publié: (2025)
par: Chow, Wei, et autres
Publié: (2025)
I3: Intent-Introspective Retrieval Conditioned on Instructions
par: Pan, Kaihang, et autres
Publié: (2023)
par: Pan, Kaihang, et autres
Publié: (2023)
Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
par: Li, Moxin, et autres
Publié: (2024)
par: Li, Moxin, et autres
Publié: (2024)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
par: Jin, Zhe, et autres
Publié: (2025)
par: Jin, Zhe, et autres
Publié: (2025)
On Path to Multimodal Generalist: General-Level and General-Bench
par: Fei, Hao, et autres
Publié: (2025)
par: Fei, Hao, et autres
Publié: (2025)
LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision
par: Xu, Jundong, et autres
Publié: (2025)
par: Xu, Jundong, et autres
Publié: (2025)
TeamLoRA: Boosting Low-Rank Adaptation with Expert Collaboration and Competition
par: Lin, Tianwei, et autres
Publié: (2024)
par: Lin, Tianwei, et autres
Publié: (2024)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
par: Chu, Meng, et autres
Publié: (2025)
par: Chu, Meng, et autres
Publié: (2025)
Learning to Ask Critical Questions for Assisting Product Search
par: Li, Zixuan, et autres
Publié: (2024)
par: Li, Zixuan, et autres
Publié: (2024)
DRAFT: Task Decoupled Latent Reasoning for Agent Safety
par: Wang, Lin, et autres
Publié: (2026)
par: Wang, Lin, et autres
Publié: (2026)
Bringing Reasoning to Generative Recommendation Through the Lens of Cascaded Ranking
par: Lin, Xinyu, et autres
Publié: (2026)
par: Lin, Xinyu, et autres
Publié: (2026)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
On Generative Agents in Recommendation
par: Zhang, An, et autres
Publié: (2023)
par: Zhang, An, et autres
Publié: (2023)
InstructSAM: Segment Any Instance with Any Instructions
par: Yuan, Yuqian, et autres
Publié: (2026)
par: Yuan, Yuqian, et autres
Publié: (2026)
Hello Again! LLM-powered Personalized Agent for Long-term Dialogue
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
Can I Trust Your Answer? Visually Grounded Video Question Answering
par: Xiao, Junbin, et autres
Publié: (2023)
par: Xiao, Junbin, et autres
Publié: (2023)
Contrastive Pre-training for Deep Session Data Understanding
par: Li, Zixuan, et autres
Publié: (2024)
par: Li, Zixuan, et autres
Publié: (2024)
A Survey on Neural Question Generation: Methods, Applications, and Prospects
par: Guo, Shasha, et autres
Publié: (2024)
par: Guo, Shasha, et autres
Publié: (2024)
Documents similaires
-
Generalist Virtual Agents: A Survey on Autonomous Agents Across Digital Platforms
par: Gao, Minghe, et autres
Publié: (2024) -
What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
par: Bu, Wendong, et autres
Publié: (2025) -
Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration
par: Chen, Weile, et autres
Publié: (2026) -
CORE: Code-based Inverse Self-Training Framework with Graph Expansion for Virtual Agents
par: Wang, Keyu, et autres
Publié: (2026) -
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
par: Pan, Kaihang, et autres
Publié: (2025)