GroundAct: Can LLM Agents Ground Actions in Environmental States?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zixuan, Li, Dingming, Li, Hongxing, Miao, Yanrui, Chen, Shuo, Yan, Yuchen, Zhang, Wenqi, Shen, Yongliang, Lu, Weiming, Xiao, Jun, Zhuang, Yueting |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
par: Li, Hongxing, et autres
Publié: (2025)
par: Li, Hongxing, et autres
Publié: (2025)
Milestone-Guided Policy Learning for Long-Horizon Language Agents
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
par: Li, Dingming, et autres
Publié: (2025)
par: Li, Dingming, et autres
Publié: (2025)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning
par: Wang, Aozhe, et autres
Publié: (2026)
par: Wang, Aozhe, et autres
Publié: (2026)
EasySteer: A Unified Framework for High-Performance and Extensible LLM Steering
par: Xu, Haolei, et autres
Publié: (2025)
par: Xu, Haolei, et autres
Publié: (2025)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
Data-Copilot: Bridging Billions of Data and Humans with Autonomous Workflow
par: Zhang, Wenqi, et autres
Publié: (2023)
par: Zhang, Wenqi, et autres
Publié: (2023)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
par: Tang, Fei, et autres
Publié: (2026)
par: Tang, Fei, et autres
Publié: (2026)
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
par: Tang, Fei, et autres
Publié: (2026)
par: Tang, Fei, et autres
Publié: (2026)
Self-Contrast: Better Reflection Through Inconsistent Solving Perspectives
par: Zhang, Wenqi, et autres
Publié: (2024)
par: Zhang, Wenqi, et autres
Publié: (2024)
A Survey on (M)LLM-Based GUI Agents
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts
par: Yuan, Fan, et autres
Publié: (2025)
par: Yuan, Fan, et autres
Publié: (2025)
Pause or Fabricate? Training Language Models for Grounded Reasoning
par: Qiu, Yiwen, et autres
Publié: (2026)
par: Qiu, Yiwen, et autres
Publié: (2026)
Let LRMs Break Free from Overthinking via Self-Braking Tuning
par: Zhao, Haoran, et autres
Publié: (2025)
par: Zhao, Haoran, et autres
Publié: (2025)
Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning
par: Xu, Haolei, et autres
Publié: (2025)
par: Xu, Haolei, et autres
Publié: (2025)
Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization
par: Zhang, Wenqi, et autres
Publié: (2024)
par: Zhang, Wenqi, et autres
Publié: (2024)
AskToAct: Enhancing LLMs Tool Use via Self-Correcting Clarification
par: Zhang, Xuan, et autres
Publié: (2025)
par: Zhang, Xuan, et autres
Publié: (2025)
Hierarchical Budget Policy Optimization for Adaptive Reasoning
par: Lyu, Shangke, et autres
Publié: (2025)
par: Lyu, Shangke, et autres
Publié: (2025)
CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution
par: Pan, Teng, et autres
Publié: (2026)
par: Pan, Teng, et autres
Publié: (2026)
2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
par: Zhang, Wenqi, et autres
Publié: (2025)
par: Zhang, Wenqi, et autres
Publié: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
par: Shen, Yongliang, et autres
Publié: (2023)
par: Shen, Yongliang, et autres
Publié: (2023)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
par: Du, Yong, et autres
Publié: (2025)
par: Du, Yong, et autres
Publié: (2025)
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
par: Xu, Haolei, et autres
Publié: (2026)
par: Xu, Haolei, et autres
Publié: (2026)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
par: Zhang, Wenqi, et autres
Publié: (2025)
par: Zhang, Wenqi, et autres
Publié: (2025)
LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization
par: Wu, Xingyu, et autres
Publié: (2025)
par: Wu, Xingyu, et autres
Publié: (2025)
Triad: A Framework Leveraging a Multi-Role LLM-based Agent to Solve Knowledge Base Question Answering
par: Zong, Chang, et autres
Publié: (2024)
par: Zong, Chang, et autres
Publié: (2024)
GaVaMoE: Gaussian-Variational Gated Mixture of Experts for Explainable Recommendation
par: Tang, Fei, et autres
Publié: (2024)
par: Tang, Fei, et autres
Publié: (2024)
UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization
par: Lu, Zhengxi, et autres
Publié: (2026)
par: Lu, Zhengxi, et autres
Publié: (2026)
KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation
par: Chen, Tongbo, et autres
Publié: (2026)
par: Chen, Tongbo, et autres
Publié: (2026)
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
par: Hong, Haitao, et autres
Publié: (2025)
par: Hong, Haitao, et autres
Publié: (2025)
ReflAct: World-Grounded Decision Making in LLM Agents via Goal-State Reflection
par: Kim, Jeonghye, et autres
Publié: (2025)
par: Kim, Jeonghye, et autres
Publié: (2025)
SMH-Bench: Benchmarking LLM Agents for Environment-Grounded Reasoning and Action in Smart Homes
par: Li, Kuan, et autres
Publié: (2026)
par: Li, Kuan, et autres
Publié: (2026)
InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models
par: Yan, Yuchen, et autres
Publié: (2025)
par: Yan, Yuchen, et autres
Publié: (2025)
SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
par: Lu, Zhengxi, et autres
Publié: (2026)
par: Lu, Zhengxi, et autres
Publié: (2026)
ActPrompt: In-Domain Feature Adaptation via Action Cues for Video Temporal Grounding
par: Wang, Yubin, et autres
Publié: (2024)
par: Wang, Yubin, et autres
Publié: (2024)
STaR-SQL: Self-Taught Reasoner for Text-to-SQL
par: He, Mingqian, et autres
Publié: (2025)
par: He, Mingqian, et autres
Publié: (2025)
Advancing Process Verification for Large Language Models via Tree-Based Preference Learning
par: He, Mingqian, et autres
Publié: (2024)
par: He, Mingqian, et autres
Publié: (2024)
TimeToM: Temporal Space is the Key to Unlocking the Door of Large Language Models' Theory-of-Mind
par: Hou, Guiyang, et autres
Publié: (2024)
par: Hou, Guiyang, et autres
Publié: (2024)
SVGenius: Benchmarking LLMs in SVG Understanding, Editing and Generation
par: Chen, Siqi, et autres
Publié: (2025)
par: Chen, Siqi, et autres
Publié: (2025)
Documents similaires
-
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
par: Li, Hongxing, et autres
Publié: (2025) -
Milestone-Guided Policy Learning for Long-Horizon Language Agents
par: Wang, Zixuan, et autres
Publié: (2026) -
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
par: Li, Dingming, et autres
Publié: (2025) -
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
par: Tang, Fei, et autres
Publié: (2025) -
Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning
par: Wang, Aozhe, et autres
Publié: (2026)