Phi-Ground Tech Report: Advancing Perception in GUI Grounding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Miaosen, Xu, Ziqiang, Zhu, Jialiang, Dai, Qi, Qiu, Kai, Yang, Yifan, Luo, Chong, Chen, Tianyi, Wagle, Justin, Franklin, Tim, Guo, Baining |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
por: Zhang, Zhenxing, et al.
Publicado: (2024)
por: Zhang, Zhenxing, et al.
Publicado: (2024)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
por: Wang, Jieyi, et al.
Publicado: (2026)
por: Wang, Jieyi, et al.
Publicado: (2026)
Music Grounding by Short Video
por: Xin, Zijie, et al.
Publicado: (2024)
por: Xin, Zijie, et al.
Publicado: (2024)
MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
por: Fang, Pengcheng, et al.
Publicado: (2026)
por: Fang, Pengcheng, et al.
Publicado: (2026)
Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web
por: Heo, Ryang, et al.
Publicado: (2026)
por: Heo, Ryang, et al.
Publicado: (2026)
Muse: A Multimodal Conversational Recommendation Dataset with Scenario-Grounded User Profiles
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses
por: Tan, Chaolei, et al.
Publicado: (2024)
por: Tan, Chaolei, et al.
Publicado: (2024)
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
por: Zhang, Meishan, et al.
Publicado: (2024)
por: Zhang, Meishan, et al.
Publicado: (2024)
Grounding is All You Need? Dual Temporal Grounding for Video Dialog
por: Qin, You, et al.
Publicado: (2024)
por: Qin, You, et al.
Publicado: (2024)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
por: Xu, Yue, et al.
Publicado: (2024)
por: Xu, Yue, et al.
Publicado: (2024)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
por: Sun, Luoyi, et al.
Publicado: (2026)
por: Sun, Luoyi, et al.
Publicado: (2026)
Scene-Text Grounding for Text-Based Video Question Answering
por: Zhou, Sheng, et al.
Publicado: (2024)
por: Zhou, Sheng, et al.
Publicado: (2024)
RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild
por: Xu, Danni, et al.
Publicado: (2026)
por: Xu, Danni, et al.
Publicado: (2026)
ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use
por: Li, Kaixin, et al.
Publicado: (2025)
por: Li, Kaixin, et al.
Publicado: (2025)
GLANCE: A Global-Local Coordination Multi-Agent Framework for Music-Grounded Non-Linear Video Editing
por: Lin, Zihao, et al.
Publicado: (2026)
por: Lin, Zihao, et al.
Publicado: (2026)
Visual Grounding with Multi-modal Conditional Adaptation
por: Yao, Ruilin, et al.
Publicado: (2024)
por: Yao, Ruilin, et al.
Publicado: (2024)
Language-Guided Diffusion Model for Visual Grounding
por: Chen, Sijia, et al.
Publicado: (2023)
por: Chen, Sijia, et al.
Publicado: (2023)
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
por: Chen, Shuang, et al.
Publicado: (2026)
por: Chen, Shuang, et al.
Publicado: (2026)
Mitigating Multimodal Inconsistency via Cognitive Dual-Pathway Reasoning for Intent Recognition
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
Grounded Chain-of-Thought for Multimodal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2025)
por: Wu, Qiong, et al.
Publicado: (2025)
Boosting Temporal Sentence Grounding via Causal Inference
por: Tang, Kefan, et al.
Publicado: (2025)
por: Tang, Kefan, et al.
Publicado: (2025)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
por: Pramanick, Shraman, et al.
Publicado: (2025)
por: Pramanick, Shraman, et al.
Publicado: (2025)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
por: Satar, Burak, et al.
Publicado: (2025)
por: Satar, Burak, et al.
Publicado: (2025)
Generative AI-enabled Mobile Tactical Multimedia Networks: Distribution, Generation, and Perception
por: Xu, Minrui, et al.
Publicado: (2024)
por: Xu, Minrui, et al.
Publicado: (2024)
When Harmful Content Gets Camouflaged: Unveiling Perception Failure of LVLMs with CamHarmTI
por: Li, Yanhui, et al.
Publicado: (2025)
por: Li, Yanhui, et al.
Publicado: (2025)
A Video Steganography for H.265/HEVC Based on Multiple CU Size and Block Structure Distortion
por: Zhang, Xiang, et al.
Publicado: (2026)
por: Zhang, Xiang, et al.
Publicado: (2026)
Advancing Grounded Multimodal Named Entity Recognition via LLM-Based Reformulation and Box-Based Segmentation
por: Li, Jinyuan, et al.
Publicado: (2024)
por: Li, Jinyuan, et al.
Publicado: (2024)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
por: Yang, Danni, et al.
Publicado: (2024)
por: Yang, Danni, et al.
Publicado: (2024)
Dual Enhancement on 3D Vision-Language Perception for Monocular 3D Visual Grounding
por: Li, Yuzhen, et al.
Publicado: (2025)
por: Li, Yuzhen, et al.
Publicado: (2025)
A New Dataset and Benchmark for Grounding Multimodal Misinformation
por: Yang, Bingjian, et al.
Publicado: (2025)
por: Yang, Bingjian, et al.
Publicado: (2025)
Text-controlled Motion Mamba: Text-Instructed Temporal Grounding of Human Motion
por: Wang, Xinghan, et al.
Publicado: (2024)
por: Wang, Xinghan, et al.
Publicado: (2024)
Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval
por: Liao, Liwei, et al.
Publicado: (2025)
por: Liao, Liwei, et al.
Publicado: (2025)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
por: Li, Wenrui, et al.
Publicado: (2024)
por: Li, Wenrui, et al.
Publicado: (2024)
Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
por: Jin, Hyundong, et al.
Publicado: (2025)
por: Jin, Hyundong, et al.
Publicado: (2025)
Interdisciplinary Translations: Sensory Perception as a Universal Language
por: Kang, Xindi, et al.
Publicado: (2024)
por: Kang, Xindi, et al.
Publicado: (2024)
Task Presentation and Human Perception in Interactive Video Retrieval
por: Willis, Nina, et al.
Publicado: (2024)
por: Willis, Nina, et al.
Publicado: (2024)
Automatic Prompt Generation and Grounding Object Detection for Zero-Shot Image Anomaly Detection
por: Cheung, Tsun-Hin, et al.
Publicado: (2024)
por: Cheung, Tsun-Hin, et al.
Publicado: (2024)
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
por: Liu, Ting, et al.
Publicado: (2024)
por: Liu, Ting, et al.
Publicado: (2024)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
por: Ilaslan, Muhammet Furkan, et al.
Publicado: (2024)
por: Ilaslan, Muhammet Furkan, et al.
Publicado: (2024)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
por: Zhao, Qihao, et al.
Publicado: (2026)
por: Zhao, Qihao, et al.
Publicado: (2026)
Ejemplares similares
-
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
por: Zhang, Zhenxing, et al.
Publicado: (2024) -
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
por: Wang, Jieyi, et al.
Publicado: (2026) -
Music Grounding by Short Video
por: Xin, Zijie, et al.
Publicado: (2024) -
MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
por: Fang, Pengcheng, et al.
Publicado: (2026) -
Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web
por: Heo, Ryang, et al.
Publicado: (2026)