Reasoning Matters for 3D Visual Grounding
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Hsiang-Wei, Chen, Kuang-Ming, Chai, Wenhao, Yang, Cheng-Yen, Cheng, Jen-Hao, Hwang, Jenq-Neng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ToSA: Token Merging with Spatial Awareness
por: Huang, Hsiang-Wei, et al.
Publicado: (2025)
por: Huang, Hsiang-Wei, et al.
Publicado: (2025)
SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory
por: Yang, Cheng-Yen, et al.
Publicado: (2024)
por: Yang, Cheng-Yen, et al.
Publicado: (2024)
MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
por: Huang, Hsiang-Wei, et al.
Publicado: (2024)
por: Huang, Hsiang-Wei, et al.
Publicado: (2024)
CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models
por: Huang, Hsiang-Wei, et al.
Publicado: (2026)
por: Huang, Hsiang-Wei, et al.
Publicado: (2026)
Boosting Online 3D Multi-Object Tracking through Camera-Radar Cross Check
por: Kuan, Sheng-Yao, et al.
Publicado: (2024)
por: Kuan, Sheng-Yao, et al.
Publicado: (2024)
Technical Report for ReID-SAM on SkiTB Visual Tracking Challenge 2025
por: Li, Kunjun, et al.
Publicado: (2025)
por: Li, Kunjun, et al.
Publicado: (2025)
PackDiT: Joint Human Motion and Text Generation via Mutual Prompting
por: Jiang, Zhongyu, et al.
Publicado: (2025)
por: Jiang, Zhongyu, et al.
Publicado: (2025)
GTA: Global Tracklet Association for Multi-Object Tracking in Sports
por: Sun, Jiacheng, et al.
Publicado: (2024)
por: Sun, Jiacheng, et al.
Publicado: (2024)
RT-Pose: A 4D Radar Tensor-based 3D Human Pose Estimation and Localization Benchmark
por: Ho, Yuan-Hao, et al.
Publicado: (2024)
por: Ho, Yuan-Hao, et al.
Publicado: (2024)
UniHPR: Unified Human Pose Representation via Singular Value Contrastive Learning
por: Jiang, Zhongyu, et al.
Publicado: (2025)
por: Jiang, Zhongyu, et al.
Publicado: (2025)
A Density-Guided Temporal Attention Transformer for Indiscernible Object Counting in Underwater Video
por: Yang, Cheng-Yen, et al.
Publicado: (2024)
por: Yang, Cheng-Yen, et al.
Publicado: (2024)
TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action
por: Cheng, Jen-Hao, et al.
Publicado: (2025)
por: Cheng, Jen-Hao, et al.
Publicado: (2025)
Pointmap Association and Piecewise-Plane Constraint for Consistent and Compact 3D Gaussian Segmentation Field
por: Hu, Wenhao, et al.
Publicado: (2025)
por: Hu, Wenhao, et al.
Publicado: (2025)
Warehouse Spatial Question Answering with LLM Agent
por: Huang, Hsiang-Wei, et al.
Publicado: (2025)
por: Huang, Hsiang-Wei, et al.
Publicado: (2025)
MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling
por: Zhang, Zhenyu, et al.
Publicado: (2023)
por: Zhang, Zhenyu, et al.
Publicado: (2023)
ToddlerAct: A Toddler Action Recognition Dataset for Gross Motor Development Assessment
por: Huang, Hsiang-Wei, et al.
Publicado: (2024)
por: Huang, Hsiang-Wei, et al.
Publicado: (2024)
Single-image driven 3d viewpoint training data augmentation for effective wine label recognition
por: Huang, Yueh-Cheng, et al.
Publicado: (2024)
por: Huang, Yueh-Cheng, et al.
Publicado: (2024)
MonoTAKD: Teaching Assistant Knowledge Distillation for Monocular 3D Object Detection
por: Liu, Hou-I, et al.
Publicado: (2024)
por: Liu, Hou-I, et al.
Publicado: (2024)
Adapting SAM 2 for Visual Object Tracking: 1st Place Solution for MMVPR Challenge Multi-Modal Tracking
por: Yang, Cheng-Yen, et al.
Publicado: (2025)
por: Yang, Cheng-Yen, et al.
Publicado: (2025)
Exploring Probabilistic Modeling Beyond Domain Generalization for Semantic Segmentation
por: Chen, I-Hsiang, et al.
Publicado: (2025)
por: Chen, I-Hsiang, et al.
Publicado: (2025)
Detector-in-the-Loop Tracking: Active Memory Rectification for Stable Glottic Opening Localization
por: Wang, Huayu, et al.
Publicado: (2026)
por: Wang, Huayu, et al.
Publicado: (2026)
CityGen: Infinite and Controllable City Layout Generation
por: Deng, Jie, et al.
Publicado: (2023)
por: Deng, Jie, et al.
Publicado: (2023)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
por: Song, Enxin, et al.
Publicado: (2024)
por: Song, Enxin, et al.
Publicado: (2024)
VersaT2I: Improving Text-to-Image Models with Versatile Reward
por: Guo, Jianshu, et al.
Publicado: (2024)
por: Guo, Jianshu, et al.
Publicado: (2024)
CityCraft: A Real Crafter for 3D City Generation
por: Deng, Jie, et al.
Publicado: (2024)
por: Deng, Jie, et al.
Publicado: (2024)
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
por: Wang, Gaoang, et al.
Publicado: (2022)
por: Wang, Gaoang, et al.
Publicado: (2022)
Tree Counting by Bridging 3D Point Clouds with Imagery
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
DAug: Diffusion-based Channel Augmentation for Radiology Image Retrieval and Classification
por: Jin, Ying, et al.
Publicado: (2024)
por: Jin, Ying, et al.
Publicado: (2024)
ProFuse: Efficient Cross-View Context Fusion for Open-Vocabulary 3D Gaussian Splatting
por: Chiou, Yen-Jen, et al.
Publicado: (2026)
por: Chiou, Yen-Jen, et al.
Publicado: (2026)
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
por: Jin, Zhao, et al.
Publicado: (2025)
por: Jin, Zhao, et al.
Publicado: (2025)
ScalingGaussian: Enhancing 3D Content Creation with Generative Gaussian Splatting
por: Chen, Shen, et al.
Publicado: (2024)
por: Chen, Shen, et al.
Publicado: (2024)
ProTPS: Prototype-Guided Text Prompt Selection for Continual Learning
por: Mei, Jie, et al.
Publicado: (2026)
por: Mei, Jie, et al.
Publicado: (2026)
3DSceneEditor: Controllable 3D Scene Editing with Gaussian Splatting
por: Yan, Ziyang, et al.
Publicado: (2024)
por: Yan, Ziyang, et al.
Publicado: (2024)
AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
por: Chai, Wenhao, et al.
Publicado: (2024)
por: Chai, Wenhao, et al.
Publicado: (2024)
Understanding Identity Continuity in Thermal Video through Scene-Level Consistency
por: Sun, Wei-Chieh, et al.
Publicado: (2026)
por: Sun, Wei-Chieh, et al.
Publicado: (2026)
RAM: Recover Any 3D Human Motion in-the-Wild
por: Jia, Sen, et al.
Publicado: (2026)
por: Jia, Sen, et al.
Publicado: (2026)
OpenGround: Active Cognition-based Reasoning for Open-World 3D Visual Grounding
por: Huang, Wenyuan, et al.
Publicado: (2025)
por: Huang, Wenyuan, et al.
Publicado: (2025)
CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications
por: Zhang, Tianfang, et al.
Publicado: (2024)
por: Zhang, Tianfang, et al.
Publicado: (2024)
From Global to Local: Rethinking CLIP Feature Aggregation for Person Re-Identification
por: Zheng, Aotian, et al.
Publicado: (2026)
por: Zheng, Aotian, et al.
Publicado: (2026)
PartDistill: 3D Shape Part Segmentation by Vision-Language Model Distillation
por: Umam, Ardian, et al.
Publicado: (2023)
por: Umam, Ardian, et al.
Publicado: (2023)
Ejemplares similares
-
ToSA: Token Merging with Spatial Awareness
por: Huang, Hsiang-Wei, et al.
Publicado: (2025) -
SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory
por: Yang, Cheng-Yen, et al.
Publicado: (2024) -
MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
por: Huang, Hsiang-Wei, et al.
Publicado: (2024) -
CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models
por: Huang, Hsiang-Wei, et al.
Publicado: (2026) -
Boosting Online 3D Multi-Object Tracking through Camera-Radar Cross Check
por: Kuan, Sheng-Yao, et al.
Publicado: (2024)