DOCTR: Disentangled Object-Centric Transformer for Point Scene Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Xiaoxuan, Wang, Hao, Li, Weiming, Wang, Qiang, Cho, Soonyong, Sung, Younghun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning Disentangled Representation in Object-Centric Models for Visual Dynamics Prediction via Transformers
por: Gandhi, Sanket, et al.
Publicado: (2024)
por: Gandhi, Sanket, et al.
Publicado: (2024)
ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives
por: Fu, Yuqian, et al.
Publicado: (2024)
por: Fu, Yuqian, et al.
Publicado: (2024)
Explicitly Disentangled Representations in Object-Centric Learning
por: Majellaro, Riccardo, et al.
Publicado: (2024)
por: Majellaro, Riccardo, et al.
Publicado: (2024)
DOR3D-Net: Dense Ordinal Regression Network for 3D Hand Pose Estimation
por: Mao, Yamin, et al.
Publicado: (2024)
por: Mao, Yamin, et al.
Publicado: (2024)
ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding
por: Wang, Xucheng, et al.
Publicado: (2026)
por: Wang, Xucheng, et al.
Publicado: (2026)
TGBFormer: Transformer-GraphFormer Blender Network for Video Object Detection
por: Qi, Qiang, et al.
Publicado: (2025)
por: Qi, Qiang, et al.
Publicado: (2025)
Short-term Object Interaction Anticipation with Disentangled Object Detection @ Ego4D Short Term Object Interaction Anticipation Challenge
por: Cho, Hyunjin, et al.
Publicado: (2024)
por: Cho, Hyunjin, et al.
Publicado: (2024)
Towards Flexible 3D Perception: Object-Centric Occupancy Completion Augments 3D Object Detection
por: Zheng, Chaoda, et al.
Publicado: (2024)
por: Zheng, Chaoda, et al.
Publicado: (2024)
Object-Centric Vision Token Pruning for Vision Language Models
por: Li, Guangyuan, et al.
Publicado: (2025)
por: Li, Guangyuan, et al.
Publicado: (2025)
TripleFDS: Triple Feature Disentanglement and Synthesis for Scene Text Editing
por: Bao, Yuchen, et al.
Publicado: (2025)
por: Bao, Yuchen, et al.
Publicado: (2025)
ObjectGS: Object-aware Scene Reconstruction and Scene Understanding via Gaussian Splatting
por: Zhu, Ruijie, et al.
Publicado: (2025)
por: Zhu, Ruijie, et al.
Publicado: (2025)
OpenGS-SLAM: Open-Set Dense Semantic SLAM with 3D Gaussian Splatting for Object-Level Scene Understanding
por: Yang, Dianyi, et al.
Publicado: (2025)
por: Yang, Dianyi, et al.
Publicado: (2025)
RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene Understanding
por: Yang, Jihan, et al.
Publicado: (2023)
por: Yang, Jihan, et al.
Publicado: (2023)
InstrAct: Towards Action-Centric Understanding in Instructional Videos
por: Yang, Zhuoyi, et al.
Publicado: (2026)
por: Yang, Zhuoyi, et al.
Publicado: (2026)
UNO: Unifying One-stage Video Scene Graph Generation via Object-Centric Visual Representation Learning
por: Le, Huy, et al.
Publicado: (2025)
por: Le, Huy, et al.
Publicado: (2025)
Revisiting Salient Object Detection from an Observer-Centric Perspective
por: Zhang, Fuxi, et al.
Publicado: (2026)
por: Zhang, Fuxi, et al.
Publicado: (2026)
Allocentric Perceiver: Disentangling Allocentric Reasoning from Egocentric Visual Priors via Frame Instantiation
por: Wang, Hengyi, et al.
Publicado: (2026)
por: Wang, Hengyi, et al.
Publicado: (2026)
Local Temporal Feature Enhanced Transformer with ROI-rank Based Masking for Diagnosis of ADHD
por: Kim, Byunggun, et al.
Publicado: (2025)
por: Kim, Byunggun, et al.
Publicado: (2025)
PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos
por: Zhou, Zhiyu, et al.
Publicado: (2026)
por: Zhou, Zhiyu, et al.
Publicado: (2026)
BeyondScene: Higher-Resolution Human-Centric Scene Generation With Pretrained Diffusion
por: Kim, Gwanghyun, et al.
Publicado: (2024)
por: Kim, Gwanghyun, et al.
Publicado: (2024)
Reasoning-Enhanced Object-Centric Learning for Videos
por: Li, Jian, et al.
Publicado: (2024)
por: Li, Jian, et al.
Publicado: (2024)
Dynamic Object Queries for Transformer-based Incremental Object Detection
por: Zhang, Jichuan, et al.
Publicado: (2024)
por: Zhang, Jichuan, et al.
Publicado: (2024)
Understanding Dynamic Scenes in Ego Centric 4D Point Clouds
por: Huang, Junsheng, et al.
Publicado: (2025)
por: Huang, Junsheng, et al.
Publicado: (2025)
City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning
por: Sun, Penglei, et al.
Publicado: (2025)
por: Sun, Penglei, et al.
Publicado: (2025)
Object-Centric Latent Action Learning
por: Klepach, Albina, et al.
Publicado: (2025)
por: Klepach, Albina, et al.
Publicado: (2025)
milliFlow: Scene Flow Estimation on mmWave Radar Point Cloud for Human Motion Sensing
por: Ding, Fangqiang, et al.
Publicado: (2023)
por: Ding, Fangqiang, et al.
Publicado: (2023)
Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
por: Wang, Yaoting, et al.
Publicado: (2024)
por: Wang, Yaoting, et al.
Publicado: (2024)
CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning
por: Gan, Rui, et al.
Publicado: (2026)
por: Gan, Rui, et al.
Publicado: (2026)
SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding
por: Zeng, Nianbo, et al.
Publicado: (2025)
por: Zeng, Nianbo, et al.
Publicado: (2025)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
por: Cai, Yuxuan, et al.
Publicado: (2025)
por: Cai, Yuxuan, et al.
Publicado: (2025)
Unsupervised Anomaly Detection in Brain MRI via Disentangled Anatomy Learning
por: Yang, Tao, et al.
Publicado: (2025)
por: Yang, Tao, et al.
Publicado: (2025)
Hierarchical Object-Centric Learning with Capsule Networks
por: Renzulli, Riccardo
Publicado: (2024)
por: Renzulli, Riccardo
Publicado: (2024)
Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection
por: Seo, Soo Won, et al.
Publicado: (2026)
por: Seo, Soo Won, et al.
Publicado: (2026)
HAECcity: Open-Vocabulary Scene Understanding of City-Scale Point Clouds with Superpoint Graph Clustering
por: Rusnak, Alexander, et al.
Publicado: (2025)
por: Rusnak, Alexander, et al.
Publicado: (2025)
RPMArt: Towards Robust Perception and Manipulation for Articulated Objects
por: Wang, Junbo, et al.
Publicado: (2024)
por: Wang, Junbo, et al.
Publicado: (2024)
Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs
por: Huang, Jincai, et al.
Publicado: (2026)
por: Huang, Jincai, et al.
Publicado: (2026)
Dynamic Scene Understanding through Object-Centric Voxelization and Neural Rendering
por: Zhao, Yanpeng, et al.
Publicado: (2024)
por: Zhao, Yanpeng, et al.
Publicado: (2024)
Lifting Unlabeled Internet-level Data for 3D Scene Understanding
por: Chen, Yixin, et al.
Publicado: (2026)
por: Chen, Yixin, et al.
Publicado: (2026)
Complementary Pseudo Multimodal Feature for Point Cloud Anomaly Detection
por: Cao, Yunkang, et al.
Publicado: (2023)
por: Cao, Yunkang, et al.
Publicado: (2023)
Object-Centric 3D Gaussian Splatting for Strawberry Plant Reconstruction and Phenotyping
por: Li, Jiajia, et al.
Publicado: (2025)
por: Li, Jiajia, et al.
Publicado: (2025)
Ejemplares similares
-
Learning Disentangled Representation in Object-Centric Models for Visual Dynamics Prediction via Transformers
por: Gandhi, Sanket, et al.
Publicado: (2024) -
ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives
por: Fu, Yuqian, et al.
Publicado: (2024) -
Explicitly Disentangled Representations in Object-Centric Learning
por: Majellaro, Riccardo, et al.
Publicado: (2024) -
DOR3D-Net: Dense Ordinal Regression Network for 3D Hand Pose Estimation
por: Mao, Yamin, et al.
Publicado: (2024) -
ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding
por: Wang, Xucheng, et al.
Publicado: (2026)