Ges3ViG: Incorporating Pointing Gestures into Language-Based 3D Visual Grounding for Embodied Reference Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mane, Atharv Mahesh, Weerakoon, Dulanga, Subbaraju, Vigneshwaran, Sen, Sougata, Sarma, Sanjay E., Misra, Archan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Adaptive Environment Generation for Training Embodied Agents
par: Yeo, Teresa, et autres
Publié: (2026)
par: Yeo, Teresa, et autres
Publié: (2026)
Ges-QA: A Multidimensional Quality Assessment Dataset for Audio-to-3D Gesture Generation
par: Gao, Zhilin, et autres
Publié: (2025)
par: Gao, Zhilin, et autres
Publié: (2025)
NeuroLiDAR: Adaptive Frame Rate Depth Sensing via Neuromorphic Event-LiDAR Fusion
par: Rathnayake, Darshana, et autres
Publié: (2026)
par: Rathnayake, Darshana, et autres
Publié: (2026)
GestureHYDRA: Semantic Co-speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation
par: Yang, Quanwei, et autres
Publié: (2025)
par: Yang, Quanwei, et autres
Publié: (2025)
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
par: Qiu, Ke, et autres
Publié: (2026)
par: Qiu, Ke, et autres
Publié: (2026)
Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation
par: Jeyaraj, Rathinaraja, et autres
Publié: (2025)
par: Jeyaraj, Rathinaraja, et autres
Publié: (2025)
MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation
par: Zhao, Yuan, et autres
Publié: (2026)
par: Zhao, Yuan, et autres
Publié: (2026)
Speech2AffectiveGestures: Synthesizing Co-Speech Gestures with Generative Adversarial Affective Expression Learning
par: Bhattacharya, Uttaran, et autres
Publié: (2021)
par: Bhattacharya, Uttaran, et autres
Publié: (2021)
EmotionGesture: Audio-Driven Diverse Emotional Co-Speech 3D Gesture Generation
par: Qi, Xingqun, et autres
Publié: (2023)
par: Qi, Xingqun, et autres
Publié: (2023)
ViFusion: In-Network Tensor Fusion for Scalable Video Feature Indexing
par: Wang, Yisu, et autres
Publié: (2025)
par: Wang, Yisu, et autres
Publié: (2025)
Efficient Geometry Compression and Communication for 3D Gaussian Splatting Point Clouds
par: Xie, Liang, et autres
Publié: (2025)
par: Xie, Liang, et autres
Publié: (2025)
Perceptual Quality Assessment of Octree-RAHT Encoded 3D Point Clouds
par: Duan, Dongshuai, et autres
Publié: (2024)
par: Duan, Dongshuai, et autres
Publié: (2024)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
par: Wang, Jieyi, et autres
Publié: (2026)
par: Wang, Jieyi, et autres
Publié: (2026)
MambaGesture: Enhancing Co-Speech Gesture Generation with Mamba and Disentangled Multi-Modality Fusion
par: Fu, Chencan, et autres
Publié: (2024)
par: Fu, Chencan, et autres
Publié: (2024)
3DMambaIPF: A State Space Model for Iterative Point Cloud Filtering via Differentiable Rendering
par: Zhou, Qingyuan, et autres
Publié: (2024)
par: Zhou, Qingyuan, et autres
Publié: (2024)
TSC-PCAC: Voxel Transformer and Sparse Convolution Based Point Cloud Attribute Compression for 3D Broadcasting
par: Guo, Zixi, et autres
Publié: (2024)
par: Guo, Zixi, et autres
Publié: (2024)
Towards Unified Representation of Multi-Modal Pre-training for 3D Understanding via Differentiable Rendering
par: Fei, Ben, et autres
Publié: (2024)
par: Fei, Ben, et autres
Publié: (2024)
Exploring the Robustness of Decision-Level Through Adversarial Attacks on LLM-Based Embodied Models
par: Liu, Shuyuan, et autres
Publié: (2024)
par: Liu, Shuyuan, et autres
Publié: (2024)
I see what you mean: Co-Speech Gestures for Reference Resolution in Multimodal Dialogue
par: Ghaleb, Esam, et autres
Publié: (2025)
par: Ghaleb, Esam, et autres
Publié: (2025)
Music Grounding by Short Video
par: Xin, Zijie, et autres
Publié: (2024)
par: Xin, Zijie, et autres
Publié: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Improving the Efficiency of VVC using Partitioning of Reference Frames
par: Qureshi, Kamran, et autres
Publié: (2025)
par: Qureshi, Kamran, et autres
Publié: (2025)
PointPCA: Point Cloud Objective Quality Assessment Using PCA-Based Descriptors
par: Alexiou, Evangelos, et autres
Publié: (2021)
par: Alexiou, Evangelos, et autres
Publié: (2021)
MM-Point: Multi-View Information-Enhanced Multi-Modal Self-Supervised 3D Point Cloud Understanding
par: Yu, Hai-Tao, et autres
Publié: (2024)
par: Yu, Hai-Tao, et autres
Publié: (2024)
Multi-Reference Generative Face Video Compression with Contrastive Learning
par: Konuko, Goluck, et autres
Publié: (2024)
par: Konuko, Goluck, et autres
Publié: (2024)
Identity-Driven Multimedia Forgery Detection via Reference Assistance
par: Xu, Junhao, et autres
Publié: (2024)
par: Xu, Junhao, et autres
Publié: (2024)
SIG-Chat: Spatial Intent-Guided Conversational Gesture Generation Involving How, When and Where
par: Huang, Yiheng, et autres
Publié: (2025)
par: Huang, Yiheng, et autres
Publié: (2025)
The Sketchfab 3D Creative Commons Collection (S3D3C)
par: Spiess, Florian, et autres
Publié: (2024)
par: Spiess, Florian, et autres
Publié: (2024)
PAME: Self-Supervised Masked Autoencoder for No-Reference Point Cloud Quality Assessment
par: Shan, Ziyu, et autres
Publié: (2024)
par: Shan, Ziyu, et autres
Publié: (2024)
Volume Tracking Based Reference Mesh Extraction for Time-Varying Mesh Compression
par: Chen, Guodong, et autres
Publié: (2024)
par: Chen, Guodong, et autres
Publié: (2024)
MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
par: Fang, Pengcheng, et autres
Publié: (2026)
par: Fang, Pengcheng, et autres
Publié: (2026)
Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web
par: Heo, Ryang, et autres
Publié: (2026)
par: Heo, Ryang, et autres
Publié: (2026)
Muse: A Multimodal Conversational Recommendation Dataset with Scenario-Grounded User Profiles
par: Wang, Zihan, et autres
Publié: (2024)
par: Wang, Zihan, et autres
Publié: (2024)
Contrastive Pre-Training with Multi-View Fusion for No-Reference Point Cloud Quality Assessment
par: Shan, Ziyu, et autres
Publié: (2024)
par: Shan, Ziyu, et autres
Publié: (2024)
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
par: Zhang, Meishan, et autres
Publié: (2024)
par: Zhang, Meishan, et autres
Publié: (2024)
Robust Multi-generation Learned Compression of Point Cloud Attribute
par: Liu, Xiangzuo, et autres
Publié: (2025)
par: Liu, Xiangzuo, et autres
Publié: (2025)
Scalable On-the-fly Transcoding for Adaptive Streaming of Dynamic Point Clouds
par: Rudolph, Michael, et autres
Publié: (2026)
par: Rudolph, Michael, et autres
Publié: (2026)
An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval
par: Kandhare, Mahesh, et autres
Publié: (2024)
par: Kandhare, Mahesh, et autres
Publié: (2024)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
par: Xu, Yue, et autres
Publié: (2024)
par: Xu, Yue, et autres
Publié: (2024)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
par: Li, Zeju, et autres
Publié: (2024)
par: Li, Zeju, et autres
Publié: (2024)
Documents similaires
-
Towards Adaptive Environment Generation for Training Embodied Agents
par: Yeo, Teresa, et autres
Publié: (2026) -
Ges-QA: A Multidimensional Quality Assessment Dataset for Audio-to-3D Gesture Generation
par: Gao, Zhilin, et autres
Publié: (2025) -
NeuroLiDAR: Adaptive Frame Rate Depth Sensing via Neuromorphic Event-LiDAR Fusion
par: Rathnayake, Darshana, et autres
Publié: (2026) -
GestureHYDRA: Semantic Co-speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation
par: Yang, Quanwei, et autres
Publié: (2025) -
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
par: Qiu, Ke, et autres
Publié: (2026)