UGround: Towards Unified Visual Grounding with Unrolled Transformers
Fuente:
arXiv
Guardado en:
| Autores principales: | Qian, Rui, Yin, Xin, Deng, Chuanhang, Peng, Zhiyuan, Xiong, Jian, Zhai, Wei, Dou, Dejing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
por: Qian, Rui, et al.
Publicado: (2026)
por: Qian, Rui, et al.
Publicado: (2026)
Reasoning to Attend: Try to Understand How <SEG> Token Works
por: Qian, Rui, et al.
Publicado: (2024)
por: Qian, Rui, et al.
Publicado: (2024)
UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer
por: Deng, Tianchen, et al.
Publicado: (2025)
por: Deng, Tianchen, et al.
Publicado: (2025)
Unified Representation Space for 3D Visual Grounding
por: Zheng, Yinuo, et al.
Publicado: (2025)
por: Zheng, Yinuo, et al.
Publicado: (2025)
Uni-Animator: Towards Unified Visual Colorization
por: Chen, Xinyuan, et al.
Publicado: (2026)
por: Chen, Xinyuan, et al.
Publicado: (2026)
Context Unrolling in Omni Models
por: Yang, Ceyuan, et al.
Publicado: (2026)
por: Yang, Ceyuan, et al.
Publicado: (2026)
PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training
por: Fu, Weifu, et al.
Publicado: (2026)
por: Fu, Weifu, et al.
Publicado: (2026)
Reloc-VGGT: Visual Re-localization with Geometry Grounded Transformer
por: Deng, Tianchen, et al.
Publicado: (2025)
por: Deng, Tianchen, et al.
Publicado: (2025)
PtychoDV: Vision Transformer-Based Deep Unrolling Network for Ptychographic Image Reconstruction
por: Gan, Weijie, et al.
Publicado: (2023)
por: Gan, Weijie, et al.
Publicado: (2023)
VGGT: Visual Geometry Grounded Transformer
por: Wang, Jianyuan, et al.
Publicado: (2025)
por: Wang, Jianyuan, et al.
Publicado: (2025)
Quantized Visual Geometry Grounded Transformer
por: Feng, Weilun, et al.
Publicado: (2025)
por: Feng, Weilun, et al.
Publicado: (2025)
InstructX: Towards Unified Visual Editing with MLLM Guidance
por: Mou, Chong, et al.
Publicado: (2025)
por: Mou, Chong, et al.
Publicado: (2025)
IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring
por: Peng, Xinge, et al.
Publicado: (2026)
por: Peng, Xinge, et al.
Publicado: (2026)
Towards Visual Grounding: A Survey
por: Xiao, Linhui, et al.
Publicado: (2024)
por: Xiao, Linhui, et al.
Publicado: (2024)
An Efficient and Effective Transformer Decoder-Based Framework for Multi-Task Visual Grounding
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
Unified and Semantically Grounded Domain Adaptation for Medical Image Segmentation
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
ProxyTransformation: Preshaping Point Cloud Manifold With Proxy Attention For 3D Visual Grounding
por: Peng, Qihang, et al.
Publicado: (2025)
por: Peng, Qihang, et al.
Publicado: (2025)
Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs
por: Narnaware, Vishal, et al.
Publicado: (2026)
por: Narnaware, Vishal, et al.
Publicado: (2026)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
por: Peng, Haosong, et al.
Publicado: (2025)
por: Peng, Haosong, et al.
Publicado: (2025)
Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection
por: Wei, Guoting, et al.
Publicado: (2026)
por: Wei, Guoting, et al.
Publicado: (2026)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
AutoFocus: Uncertainty-Aware Active Visual Search for GUI Grounding
por: Yao, Ruilin, et al.
Publicado: (2026)
por: Yao, Ruilin, et al.
Publicado: (2026)
MiKASA: Multi-Key-Anchor & Scene-Aware Transformer for 3D Visual Grounding
por: Chang, Chun-Peng, et al.
Publicado: (2024)
por: Chang, Chun-Peng, et al.
Publicado: (2024)
GroundingBooth: Grounding Text-to-Image Customization
por: Xiong, Zhexiao, et al.
Publicado: (2024)
por: Xiong, Zhexiao, et al.
Publicado: (2024)
Towards Unsupervised Domain Adaptation via Domain-Transformer
por: Chuan-Xian, Ren, et al.
Publicado: (2022)
por: Chuan-Xian, Ren, et al.
Publicado: (2022)
MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding
por: Jin, Xin, et al.
Publicado: (2025)
por: Jin, Xin, et al.
Publicado: (2025)
Towards More Unified In-context Visual Understanding
por: Sheng, Dianmo, et al.
Publicado: (2023)
por: Sheng, Dianmo, et al.
Publicado: (2023)
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding
por: Zheng, Henry, et al.
Publicado: (2025)
por: Zheng, Henry, et al.
Publicado: (2025)
Aurora: Unified Video Editing with a Tool-Using Agent
por: Yu, Yongsheng, et al.
Publicado: (2026)
por: Yu, Yongsheng, et al.
Publicado: (2026)
CROP: Contextual Region-Oriented Visual Token Pruning
por: Guo, Jiawei, et al.
Publicado: (2025)
por: Guo, Jiawei, et al.
Publicado: (2025)
GVDIFF: Grounded Text-to-Video Generation with Diffusion Models
por: Dou, Huanzhang, et al.
Publicado: (2024)
por: Dou, Huanzhang, et al.
Publicado: (2024)
MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling
por: Yang, Jian, et al.
Publicado: (2024)
por: Yang, Jian, et al.
Publicado: (2024)
Unrolled Networks are Conditional Probability Flows in MRI Reconstruction
por: Qi, Kehan, et al.
Publicado: (2025)
por: Qi, Kehan, et al.
Publicado: (2025)
Virtually Unrolling the Herculaneum Papyri by Diffeomorphic Spiral Fitting
por: Henderson, Paul
Publicado: (2025)
por: Henderson, Paul
Publicado: (2025)
QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer
por: Pan, Zhizhen, et al.
Publicado: (2026)
por: Pan, Zhizhen, et al.
Publicado: (2026)
InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams
por: Yuan, Shuai, et al.
Publicado: (2026)
por: Yuan, Shuai, et al.
Publicado: (2026)
Emergent Outlier View Rejection in Visual Geometry Grounded Transformers
por: Han, Jisang, et al.
Publicado: (2025)
por: Han, Jisang, et al.
Publicado: (2025)
OptiSAR-Net++: A Large-Scale Benchmark and Transformer-Free Framework for Cross-Domain Remote Sensing Visual Grounding
por: Tang, Xiaoyu, et al.
Publicado: (2026)
por: Tang, Xiaoyu, et al.
Publicado: (2026)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
por: Song, Wei, et al.
Publicado: (2025)
por: Song, Wei, et al.
Publicado: (2025)
VL-UniTrack: A Unified Framework with Visual-Language Prompts for UAV-Ground Visual Tracking
por: Xu, Boyue, et al.
Publicado: (2026)
por: Xu, Boyue, et al.
Publicado: (2026)
Ejemplares similares
-
AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
por: Qian, Rui, et al.
Publicado: (2026) -
Reasoning to Attend: Try to Understand How <SEG> Token Works
por: Qian, Rui, et al.
Publicado: (2024) -
UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer
por: Deng, Tianchen, et al.
Publicado: (2025) -
Unified Representation Space for 3D Visual Grounding
por: Zheng, Yinuo, et al.
Publicado: (2025) -
Uni-Animator: Towards Unified Visual Colorization
por: Chen, Xinyuan, et al.
Publicado: (2026)