Towards Visual Query Localization in the 3D World
Fuente:
arXiv
Salvato in:
| Autori principali: | Peng, Liang, Tan, Bohan, Zhang, Zhipeng, Li, Haobo, Jiao, Yifan, Dong, Xingping, Zhang, Libo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GSOT3D: Towards Generic 3D Single Object Tracking in the Wild
di: Jiao, Yifan, et al.
Pubblicazione: (2024)
di: Jiao, Yifan, et al.
Pubblicazione: (2024)
VastTrack: Vast Category Visual Object Tracking
di: Peng, Liang, et al.
Pubblicazione: (2024)
di: Peng, Liang, et al.
Pubblicazione: (2024)
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework
di: Zhang, Yani, et al.
Pubblicazione: (2025)
di: Zhang, Yani, et al.
Pubblicazione: (2025)
Towards Visual Query Segmentation in the Wild
di: Fan, Bing, et al.
Pubblicazione: (2026)
di: Fan, Bing, et al.
Pubblicazione: (2026)
TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision
di: Zhai, Yukun, et al.
Pubblicazione: (2023)
di: Zhai, Yukun, et al.
Pubblicazione: (2023)
Towards High-Fidelity 3D Portrait Generation with Rich Details by Cross-View Prior-Aware Diffusion
di: Wei, Haoran, et al.
Pubblicazione: (2024)
di: Wei, Haoran, et al.
Pubblicazione: (2024)
RaCFormer: Towards High-Quality 3D Object Detection via Query-based Radar-Camera Fusion
di: Chu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Chu, Xiaomeng, et al.
Pubblicazione: (2024)
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2026)
di: Zhou, Xin, et al.
Pubblicazione: (2026)
EAGLE: Episodic Appearance- and Geometry-aware Memory for Unified 2D-3D Visual Query Localization in Egocentric Vision
di: Cao, Yifei, et al.
Pubblicazione: (2025)
di: Cao, Yifei, et al.
Pubblicazione: (2025)
UniPLV: Towards Label-Efficient Open-World 3D Scene Understanding by Regional Visual Language Supervision
di: Wang, Yuru, et al.
Pubblicazione: (2024)
di: Wang, Yuru, et al.
Pubblicazione: (2024)
WorldTree: Towards 4D Dynamic Worlds from Monocular Video using Tree-Chains
di: Wang, Qisen, et al.
Pubblicazione: (2026)
di: Wang, Qisen, et al.
Pubblicazione: (2026)
Attention to Trajectory: Trajectory-Aware Open-Vocabulary Tracking
di: Li, Yunhao, et al.
Pubblicazione: (2025)
di: Li, Yunhao, et al.
Pubblicazione: (2025)
Towards Long-Form Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2026)
di: Gu, Xin, et al.
Pubblicazione: (2026)
PlanarTrack: A high-quality and challenging benchmark for large-scale planar object tracking
di: Jiao, Yifan, et al.
Pubblicazione: (2025)
di: Jiao, Yifan, et al.
Pubblicazione: (2025)
AQD: Towards Accurate Fully-Quantized Object Detection
di: Chen, Peng, et al.
Pubblicazione: (2020)
di: Chen, Peng, et al.
Pubblicazione: (2020)
Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code
di: Lin, Haobo, et al.
Pubblicazione: (2026)
di: Lin, Haobo, et al.
Pubblicazione: (2026)
World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
di: Wang, Weijie, et al.
Pubblicazione: (2026)
di: Wang, Weijie, et al.
Pubblicazione: (2026)
VisRefiner: Learning from Visual Differences for Screenshot-to-Code Generation
di: Deng, Jie, et al.
Pubblicazione: (2026)
di: Deng, Jie, et al.
Pubblicazione: (2026)
Bootstrapping Referring Multi-Object Tracking
di: Zhang, Yani, et al.
Pubblicazione: (2024)
di: Zhang, Yani, et al.
Pubblicazione: (2024)
From Web to Pixels: Bringing Agentic Search into Visual Perception
di: Yang, Bokang, et al.
Pubblicazione: (2026)
di: Yang, Bokang, et al.
Pubblicazione: (2026)
Towards Zero-shot 3D Anomaly Localization
di: Wang, Yizhou, et al.
Pubblicazione: (2024)
di: Wang, Yizhou, et al.
Pubblicazione: (2024)
How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing
di: Zhang, Huanyu, et al.
Pubblicazione: (2026)
di: Zhang, Huanyu, et al.
Pubblicazione: (2026)
Rethinking Temporal Fusion with a Unified Gradient Descent View for 3D Semantic Occupancy Prediction
di: Chen, Dubing, et al.
Pubblicazione: (2025)
di: Chen, Dubing, et al.
Pubblicazione: (2025)
RayFormer: Improving Query-Based Multi-Camera 3D Object Detection via Ray-Centric Strategies
di: Chu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Chu, Xiaomeng, et al.
Pubblicazione: (2024)
PRVQL: Progressive Knowledge-guided Refinement for Robust Egocentric Visual Query Localization
di: Fan, Bing, et al.
Pubblicazione: (2025)
di: Fan, Bing, et al.
Pubblicazione: (2025)
Towards 3D Objectness Learning in an Open World
di: Liu, Taichi, et al.
Pubblicazione: (2025)
di: Liu, Taichi, et al.
Pubblicazione: (2025)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
di: Yao, Jiali, et al.
Pubblicazione: (2025)
di: Yao, Jiali, et al.
Pubblicazione: (2025)
MR-COSMO: Visual-Text Memory Recall and Direct CrOSs-MOdal Alignment Method for Query-Driven 3D Segmentation
di: Li, Chade, et al.
Pubblicazione: (2025)
di: Li, Chade, et al.
Pubblicazione: (2025)
Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs
di: Zhang, Libo, et al.
Pubblicazione: (2026)
di: Zhang, Libo, et al.
Pubblicazione: (2026)
One View, Many Worlds: Single-Image to 3D Object Meets Generative Domain Randomization for One-Shot 6D Pose Estimation
di: Geng, Zheng, et al.
Pubblicazione: (2025)
di: Geng, Zheng, et al.
Pubblicazione: (2025)
SplatLoc: 3D Gaussian Splatting-based Visual Localization for Augmented Reality
di: Zhai, Hongjia, et al.
Pubblicazione: (2024)
di: Zhai, Hongjia, et al.
Pubblicazione: (2024)
TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting
di: Tan, Yuyang, et al.
Pubblicazione: (2026)
di: Tan, Yuyang, et al.
Pubblicazione: (2026)
TeleWorld: Towards Dynamic Multimodal Synthesis with a 4D World Model
di: Chen, Yabo, et al.
Pubblicazione: (2025)
di: Chen, Yabo, et al.
Pubblicazione: (2025)
HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization
di: Chang, Joohyun, et al.
Pubblicazione: (2025)
di: Chang, Joohyun, et al.
Pubblicazione: (2025)
HiLo: Detailed and Robust 3D Clothed Human Reconstruction with High-and Low-Frequency Information of Parametric Models
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
Learning Triangular Distribution in Visual World
di: Chen, Ping, et al.
Pubblicazione: (2023)
di: Chen, Ping, et al.
Pubblicazione: (2023)
FUSER: Feed-Forward MUltiview 3D Registration Transformer and SE(3)$^N$ Diffusion Refinement
di: Jiang, Haobo, et al.
Pubblicazione: (2025)
di: Jiang, Haobo, et al.
Pubblicazione: (2025)
Understanding and Evaluating Hallucinations in 3D Visual Language Models
di: Peng, Ruiying, et al.
Pubblicazione: (2025)
di: Peng, Ruiying, et al.
Pubblicazione: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
NaviNeRF: NeRF-based 3D Representation Disentanglement by Latent Semantic Navigation
di: Xie, Baao, et al.
Pubblicazione: (2023)
di: Xie, Baao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
GSOT3D: Towards Generic 3D Single Object Tracking in the Wild
di: Jiao, Yifan, et al.
Pubblicazione: (2024) -
VastTrack: Vast Category Visual Object Tracking
di: Peng, Liang, et al.
Pubblicazione: (2024) -
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework
di: Zhang, Yani, et al.
Pubblicazione: (2025) -
Towards Visual Query Segmentation in the Wild
di: Fan, Bing, et al.
Pubblicazione: (2026) -
TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision
di: Zhai, Yukun, et al.
Pubblicazione: (2023)