BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Shaojie, Zhang, Ruoceng, Fu, Pei, Wang, Shaokang, Yang, Jiahui, Du, Xin, Cui, Shiqi, Qin, Bin, Huang, Ying, Luo, Zhenbo, Luan, Jian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models
von: Wang, Shaokang, et al.
Veröffentlicht: (2026)
von: Wang, Shaokang, et al.
Veröffentlicht: (2026)
Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning
von: Zhang, Shaojie, et al.
Veröffentlicht: (2025)
von: Zhang, Shaojie, et al.
Veröffentlicht: (2025)
Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment
von: Sun, Yuchen, et al.
Veröffentlicht: (2026)
von: Sun, Yuchen, et al.
Veröffentlicht: (2026)
Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs
von: Zhang, Shaojie, et al.
Veröffentlicht: (2025)
von: Zhang, Shaojie, et al.
Veröffentlicht: (2025)
Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
von: Tan, Wenhui, et al.
Veröffentlicht: (2025)
von: Tan, Wenhui, et al.
Veröffentlicht: (2025)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
von: Qi, Yukun, et al.
Veröffentlicht: (2026)
von: Qi, Yukun, et al.
Veröffentlicht: (2026)
IMTBench: A Multi-Scenario Cross-Modal Collaborative Evaluation Benchmark for In-Image Machine Translation
von: Lyu, Jiahao, et al.
Veröffentlicht: (2026)
von: Lyu, Jiahao, et al.
Veröffentlicht: (2026)
Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
von: Zhang, Yiru, et al.
Veröffentlicht: (2025)
von: Zhang, Yiru, et al.
Veröffentlicht: (2025)
UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning
von: Chen, Liangyu, et al.
Veröffentlicht: (2025)
von: Chen, Liangyu, et al.
Veröffentlicht: (2025)
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
von: Xu, Longwei, et al.
Veröffentlicht: (2026)
von: Xu, Longwei, et al.
Veröffentlicht: (2026)
ShowUI-Aloha: Human-Taught GUI Agent
von: Zhang, Yichun, et al.
Veröffentlicht: (2026)
von: Zhang, Yichun, et al.
Veröffentlicht: (2026)
UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics
von: Wu, Mengzhou, et al.
Veröffentlicht: (2026)
von: Wu, Mengzhou, et al.
Veröffentlicht: (2026)
Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation
von: Qu, Heng, et al.
Veröffentlicht: (2026)
von: Qu, Heng, et al.
Veröffentlicht: (2026)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
von: Qin, Yujia, et al.
Veröffentlicht: (2025)
von: Qin, Yujia, et al.
Veröffentlicht: (2025)
GUI-PRA: Process Reward Agent for GUI Tasks
von: Xiong, Tao, et al.
Veröffentlicht: (2025)
von: Xiong, Tao, et al.
Veröffentlicht: (2025)
MAI-UI Technical Report: Real-World Centric Foundation GUI Agents
von: Zhou, Hanzhang, et al.
Veröffentlicht: (2025)
von: Zhou, Hanzhang, et al.
Veröffentlicht: (2025)
EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
von: Fang, Yiyang, et al.
Veröffentlicht: (2026)
von: Fang, Yiyang, et al.
Veröffentlicht: (2026)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
von: Gao, Longxi, et al.
Veröffentlicht: (2025)
von: Gao, Longxi, et al.
Veröffentlicht: (2025)
Aria-UI: Visual Grounding for GUI Instructions
von: Yang, Yuhao, et al.
Veröffentlicht: (2024)
von: Yang, Yuhao, et al.
Veröffentlicht: (2024)
UI-KOBE: Knowledge-Oriented Behavior Exploration for Lightweight Graph-Guided GUI Agents
von: Chai, Yuxiang, et al.
Veröffentlicht: (2026)
von: Chai, Yuxiang, et al.
Veröffentlicht: (2026)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
von: Guan, Yiran, et al.
Veröffentlicht: (2026)
von: Guan, Yiran, et al.
Veröffentlicht: (2026)
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
von: Guan, Yiran, et al.
Veröffentlicht: (2026)
von: Guan, Yiran, et al.
Veröffentlicht: (2026)
BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2025)
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2025)
Ferret-UI Lite: Lessons from Building Small On-Device GUI Agents
von: Yang, Zhen, et al.
Veröffentlicht: (2025)
von: Yang, Zhen, et al.
Veröffentlicht: (2025)
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
von: Wang, Haoming, et al.
Veröffentlicht: (2025)
von: Wang, Haoming, et al.
Veröffentlicht: (2025)
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
von: Li, Yuankai, et al.
Veröffentlicht: (2026)
von: Li, Yuankai, et al.
Veröffentlicht: (2026)
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
von: Zhang, Bofei, et al.
Veröffentlicht: (2025)
von: Zhang, Bofei, et al.
Veröffentlicht: (2025)
Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection
von: Yang, Wenkui, et al.
Veröffentlicht: (2026)
von: Yang, Wenkui, et al.
Veröffentlicht: (2026)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
von: Lin, Kevin Qinghong, et al.
Veröffentlicht: (2024)
von: Lin, Kevin Qinghong, et al.
Veröffentlicht: (2024)
PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA
von: Zheng, Yuanlei, et al.
Veröffentlicht: (2026)
von: Zheng, Yuanlei, et al.
Veröffentlicht: (2026)
Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately
von: Wang, Yuhang, et al.
Veröffentlicht: (2025)
von: Wang, Yuhang, et al.
Veröffentlicht: (2025)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
von: Wu, Qianhui, et al.
Veröffentlicht: (2025)
von: Wu, Qianhui, et al.
Veröffentlicht: (2025)
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
von: Chen, Ruihan, et al.
Veröffentlicht: (2025)
von: Chen, Ruihan, et al.
Veröffentlicht: (2025)
UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning
von: Lu, Zhengxi, et al.
Veröffentlicht: (2025)
von: Lu, Zhengxi, et al.
Veröffentlicht: (2025)
UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience
von: Lin, Zichuan, et al.
Veröffentlicht: (2026)
von: Lin, Zichuan, et al.
Veröffentlicht: (2026)
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
von: Tang, Liujian, et al.
Veröffentlicht: (2025)
von: Tang, Liujian, et al.
Veröffentlicht: (2025)
Executable Agentic Memory for GUI Agent
von: Qin, Zerui, et al.
Veröffentlicht: (2026)
von: Qin, Zerui, et al.
Veröffentlicht: (2026)
AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale
von: Wang, Ziyang, et al.
Veröffentlicht: (2025)
von: Wang, Ziyang, et al.
Veröffentlicht: (2025)
UI-E2I-Synth: Advancing GUI Grounding with Large-Scale Instruction Synthesis
von: Liu, Xinyi, et al.
Veröffentlicht: (2025)
von: Liu, Xinyi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models
von: Wang, Shaokang, et al.
Veröffentlicht: (2026) -
Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning
von: Zhang, Shaojie, et al.
Veröffentlicht: (2025) -
Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment
von: Sun, Yuchen, et al.
Veröffentlicht: (2026) -
Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs
von: Zhang, Shaojie, et al.
Veröffentlicht: (2025) -
Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
von: Tan, Wenhui, et al.
Veröffentlicht: (2025)