Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Duo, Huang, Shijia, Wang, Liwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
por: Zheng, Duo, et al.
Publicado: (2025)
por: Zheng, Duo, et al.
Publicado: (2025)
NeMo: Needle in a Montage for Video-Language Understanding
por: Hu, Zi-Yuan, et al.
Publicado: (2025)
por: Hu, Zi-Yuan, et al.
Publicado: (2025)
Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding
por: Shi, Shuyao, et al.
Publicado: (2026)
por: Shi, Shuyao, et al.
Publicado: (2026)
Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding
por: Wang, Yan, et al.
Publicado: (2025)
por: Wang, Yan, et al.
Publicado: (2025)
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
por: Zheng, Duo, et al.
Publicado: (2025)
por: Zheng, Duo, et al.
Publicado: (2025)
CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation
por: Huang, Kaiyi, et al.
Publicado: (2026)
por: Huang, Kaiyi, et al.
Publicado: (2026)
Enhancing Temporal Modeling of Video LLMs via Time Gating
por: Hu, Zi-Yuan, et al.
Publicado: (2024)
por: Hu, Zi-Yuan, et al.
Publicado: (2024)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
por: Dou, Zi-Yi, et al.
Publicado: (2024)
por: Dou, Zi-Yi, et al.
Publicado: (2024)
3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding
por: Huang, Xiaohu, et al.
Publicado: (2025)
por: Huang, Xiaohu, et al.
Publicado: (2025)
VideoChat: Chat-Centric Video Understanding
por: Li, KunChang, et al.
Publicado: (2023)
por: Li, KunChang, et al.
Publicado: (2023)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding
por: Linghu, Xiongkun, et al.
Publicado: (2026)
por: Linghu, Xiongkun, et al.
Publicado: (2026)
GaussVideoDreamer: 3D Scene Generation with Video Diffusion and Inconsistency-Aware Gaussian Splatting
por: Hao, Junlin, et al.
Publicado: (2025)
por: Hao, Junlin, et al.
Publicado: (2025)
Towards Learning a Generalist Model for Embodied Navigation
por: Zheng, Duo, et al.
Publicado: (2023)
por: Zheng, Duo, et al.
Publicado: (2023)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
por: Qi, Zhangyang, et al.
Publicado: (2025)
por: Qi, Zhangyang, et al.
Publicado: (2025)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
por: Jia, Baoxiong, et al.
Publicado: (2024)
por: Jia, Baoxiong, et al.
Publicado: (2024)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
por: Wang, Jiapeng, et al.
Publicado: (2024)
por: Wang, Jiapeng, et al.
Publicado: (2024)
SurgCUT3R: Surgical Scene-Aware Continuous Understanding of Temporal 3D Representation
por: Xu, Kaiyuan, et al.
Publicado: (2026)
por: Xu, Kaiyuan, et al.
Publicado: (2026)
Video Perception Models for 3D Scene Synthesis
por: Huang, Rui, et al.
Publicado: (2025)
por: Huang, Rui, et al.
Publicado: (2025)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
por: Wang, Ziyang, et al.
Publicado: (2024)
por: Wang, Ziyang, et al.
Publicado: (2024)
VideoStudio: Generating Consistent-Content and Multi-Scene Videos
por: Long, Fuchen, et al.
Publicado: (2024)
por: Long, Fuchen, et al.
Publicado: (2024)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
por: Luo, Fuwen, et al.
Publicado: (2025)
por: Luo, Fuwen, et al.
Publicado: (2025)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
por: Yang, Zongxin, et al.
Publicado: (2024)
por: Yang, Zongxin, et al.
Publicado: (2024)
Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description
por: Ahmed, Mahmoud, et al.
Publicado: (2024)
por: Ahmed, Mahmoud, et al.
Publicado: (2024)
GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents
por: Wang, Yunzhe, et al.
Publicado: (2026)
por: Wang, Yunzhe, et al.
Publicado: (2026)
VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
por: Wang, Hanyang, et al.
Publicado: (2025)
por: Wang, Hanyang, et al.
Publicado: (2025)
Fine-grained Spatiotemporal Grounding on Egocentric Videos
por: Liang, Shuo, et al.
Publicado: (2025)
por: Liang, Shuo, et al.
Publicado: (2025)
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
por: Man, Yunze, et al.
Publicado: (2024)
por: Man, Yunze, et al.
Publicado: (2024)
SceneCritic: A Symbolic Evaluator for 3D Indoor Scene Synthesis
por: Sengupta, Kathakoli, et al.
Publicado: (2026)
por: Sengupta, Kathakoli, et al.
Publicado: (2026)
Enhancing Generalizability of Representation Learning for Data-Efficient 3D Scene Understanding
por: Wang, Yunsong, et al.
Publicado: (2024)
por: Wang, Yunsong, et al.
Publicado: (2024)
VoxRep: Enhancing 3D Spatial Understanding in 2D Vision-Language Models via Voxel Representation
por: Dao, Alan, et al.
Publicado: (2025)
por: Dao, Alan, et al.
Publicado: (2025)
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
por: Lin, Jingyang, et al.
Publicado: (2025)
por: Lin, Jingyang, et al.
Publicado: (2025)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
A Study of the Framework and Real-World Applications of Language Embedding for 3D Scene Understanding
por: Zaouali, Mahmoud Chick, et al.
Publicado: (2025)
por: Zaouali, Mahmoud Chick, et al.
Publicado: (2025)
DC-Scene: Data-Centric Learning for 3D Scene Understanding
por: Huang, Ting, et al.
Publicado: (2025)
por: Huang, Ting, et al.
Publicado: (2025)
Video Understanding with Large Language Models: A Survey
por: Tang, Yolo Y., et al.
Publicado: (2023)
por: Tang, Yolo Y., et al.
Publicado: (2023)
EgoGaussian: Dynamic Scene Understanding from Egocentric Video with 3D Gaussian Splatting
por: Zhang, Daiwei, et al.
Publicado: (2024)
por: Zhang, Daiwei, et al.
Publicado: (2024)
V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes
por: Zhang, Yanming, et al.
Publicado: (2025)
por: Zhang, Yanming, et al.
Publicado: (2025)
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
por: Wang, Yueqian, et al.
Publicado: (2024)
por: Wang, Yueqian, et al.
Publicado: (2024)
KeyVideoLLM: Towards Large-scale Video Keyframe Selection
por: Liang, Hao, et al.
Publicado: (2024)
por: Liang, Hao, et al.
Publicado: (2024)
Ejemplares similares
-
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
por: Zheng, Duo, et al.
Publicado: (2025) -
NeMo: Needle in a Montage for Video-Language Understanding
por: Hu, Zi-Yuan, et al.
Publicado: (2025) -
Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding
por: Shi, Shuyao, et al.
Publicado: (2026) -
Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding
por: Wang, Yan, et al.
Publicado: (2025) -
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
por: Zheng, Duo, et al.
Publicado: (2025)