Multi-Modal Video Dialog State Tracking in the Wild
Fuente:
arXiv
Guardado en:
| Autores principales: | Abdessaied, Adnen, Shi, Lei, Bulling, Andreas |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OLViT: Multi-Modal State Tracking via Attention-Based Embeddings for Video-Grounded Dialog
por: Abdessaied, Adnen, et al.
Publicado: (2024)
por: Abdessaied, Adnen, et al.
Publicado: (2024)
V$^2$Dial: Unification of Video and Visual Dialog via Multimodal Experts
por: Abdessaied, Adnen, et al.
Publicado: (2025)
por: Abdessaied, Adnen, et al.
Publicado: (2025)
ActionDiffusion: An Action-aware Diffusion Model for Procedure Planning in Instructional Videos
por: Shi, Lei, et al.
Publicado: (2024)
por: Shi, Lei, et al.
Publicado: (2024)
CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning
por: Shi, Lei, et al.
Publicado: (2025)
por: Shi, Lei, et al.
Publicado: (2025)
VSA4VQA: Scaling a Vector Symbolic Architecture to Visual Question Answering on Natural Images
por: Penzkofer, Anna, et al.
Publicado: (2024)
por: Penzkofer, Anna, et al.
Publicado: (2024)
Zero-Shot Multi-Animal Tracking in the Wild
por: Meier, Jan Frederik, et al.
Publicado: (2025)
por: Meier, Jan Frederik, et al.
Publicado: (2025)
UP-FacE: User-predictable Fine-grained Face Shape Editing
por: Strohm, Florian, et al.
Publicado: (2024)
por: Strohm, Florian, et al.
Publicado: (2024)
HAIFAI: Human-AI Interaction for Mental Face Reconstruction
por: Strohm, Florian, et al.
Publicado: (2024)
por: Strohm, Florian, et al.
Publicado: (2024)
Limits of Theory of Mind Modelling in Dialogue-Based Collaborative Plan Acquisition
por: Bortoletto, Matteo, et al.
Publicado: (2024)
por: Bortoletto, Matteo, et al.
Publicado: (2024)
UBATrack: Spatio-Temporal State Space Model for General Multi-Modal Tracking
por: Liang, Qihua, et al.
Publicado: (2026)
por: Liang, Qihua, et al.
Publicado: (2026)
Correspondence as Video: Test-Time Adaption on SAM2 for Reference Segmentation in the Wild
por: Wang, Haoran, et al.
Publicado: (2025)
por: Wang, Haoran, et al.
Publicado: (2025)
Multi-Modal Dataset Distillation in the Wild
por: Dang, Zhuohang, et al.
Publicado: (2025)
por: Dang, Zhuohang, et al.
Publicado: (2025)
DialogCC: An Automated Pipeline for Creating High-Quality Multi-Modal Dialogue Dataset
por: Lee, Young-Jun, et al.
Publicado: (2022)
por: Lee, Young-Jun, et al.
Publicado: (2022)
Single-Model and Any-Modality for Video Object Tracking
por: Wu, Zongwei, et al.
Publicado: (2023)
por: Wu, Zongwei, et al.
Publicado: (2023)
SwiTrack: Tri-State Switch for Cross-Modal Object Tracking
por: Xu, Boyue, et al.
Publicado: (2025)
por: Xu, Boyue, et al.
Publicado: (2025)
Enhancing Visual Dialog State Tracking through Iterative Object-Entity Alignment in Multi-Round Conversations
por: Pang, Wei, et al.
Publicado: (2024)
por: Pang, Wei, et al.
Publicado: (2024)
GazeMotion: Gaze-guided Human Motion Forecasting
por: Hu, Zhiming, et al.
Publicado: (2024)
por: Hu, Zhiming, et al.
Publicado: (2024)
HOIGaze: Gaze Estimation During Hand-Object Interactions in Extended Reality Exploiting Eye-Hand-Head Coordination
por: Hu, Zhiming, et al.
Publicado: (2025)
por: Hu, Zhiming, et al.
Publicado: (2025)
GazeMoDiff: Gaze-guided Diffusion Model for Stochastic Human Motion Prediction
por: Yan, Haodong, et al.
Publicado: (2023)
por: Yan, Haodong, et al.
Publicado: (2023)
Pose2Gaze: Eye-body Coordination during Daily Activities for Gaze Prediction from Full-body Poses
por: Hu, Zhiming, et al.
Publicado: (2023)
por: Hu, Zhiming, et al.
Publicado: (2023)
HAGI++: Head-Assisted Gaze Imputation and Generation
por: Jiao, Chuhan, et al.
Publicado: (2025)
por: Jiao, Chuhan, et al.
Publicado: (2025)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
por: Shi, Min, et al.
Publicado: (2025)
por: Shi, Min, et al.
Publicado: (2025)
BaboonLand Dataset: Tracking Primates in the Wild and Automating Behaviour Recognition from Drone Videos
por: Duporge, Isla, et al.
Publicado: (2024)
por: Duporge, Isla, et al.
Publicado: (2024)
Tracking Virtual Meetings in the Wild: Re-identification in Multi-Participant Virtual Meetings
por: Perl, Oriel, et al.
Publicado: (2024)
por: Perl, Oriel, et al.
Publicado: (2024)
TrackVLA: Embodied Visual Tracking in the Wild
por: Wang, Shaoan, et al.
Publicado: (2025)
por: Wang, Shaoan, et al.
Publicado: (2025)
RegTrack: Simplicity Beneath Complexity in Robust Multi-Modal 3D Multi-Object Tracking
por: Gu, Lipeng, et al.
Publicado: (2024)
por: Gu, Lipeng, et al.
Publicado: (2024)
On Learning Multi-Modal Forgery Representation for Diffusion Generated Video Detection
por: Song, Xiufeng, et al.
Publicado: (2024)
por: Song, Xiufeng, et al.
Publicado: (2024)
Exploring Modality-Aware Fusion and Decoupled Temporal Propagation for Multi-Modal Object Tracking
por: Wang, Shilei, et al.
Publicado: (2026)
por: Wang, Shilei, et al.
Publicado: (2026)
MultiCOIN: Multi-Modal COntrollable Video INbetweening
por: Tanveer, Maham, et al.
Publicado: (2025)
por: Tanveer, Maham, et al.
Publicado: (2025)
MultiPly: Reconstruction of Multiple People from Monocular Video in the Wild
por: Jiang, Zeren, et al.
Publicado: (2024)
por: Jiang, Zeren, et al.
Publicado: (2024)
Sparse-Dense Mixture of Experts Adapter for Multi-Modal Tracking
por: Zhu, Yabin, et al.
Publicado: (2026)
por: Zhu, Yabin, et al.
Publicado: (2026)
HOIMotion: Forecasting Human Motion During Human-Object Interactions Using Egocentric 3D Object Bounding Boxes
por: Hu, Zhiming, et al.
Publicado: (2024)
por: Hu, Zhiming, et al.
Publicado: (2024)
SurgiTrack: Fine-Grained Multi-Class Multi-Tool Tracking in Surgical Videos
por: Nwoye, Chinedu Innocent, et al.
Publicado: (2024)
por: Nwoye, Chinedu Innocent, et al.
Publicado: (2024)
MultiModal Action Conditioned Video Generation
por: Li, Yichen, et al.
Publicado: (2025)
por: Li, Yichen, et al.
Publicado: (2025)
Ego-Exo 3D Hand Tracking in the Wild with a Mobile Multi-Camera Rig
por: Rim, Patrick, et al.
Publicado: (2025)
por: Rim, Patrick, et al.
Publicado: (2025)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
por: Bai, Purui, et al.
Publicado: (2026)
por: Bai, Purui, et al.
Publicado: (2026)
TeamTrack: A Dataset for Multi-Sport Multi-Object Tracking in Full-pitch Videos
por: Scott, Atom, et al.
Publicado: (2024)
por: Scott, Atom, et al.
Publicado: (2024)
DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking
por: Li, Weiran, et al.
Publicado: (2025)
por: Li, Weiran, et al.
Publicado: (2025)
Learning Frequency and Memory-Aware Prompts for Multi-Modal Object Tracking
por: Xu, Boyue, et al.
Publicado: (2025)
por: Xu, Boyue, et al.
Publicado: (2025)
Learning User Embeddings from Human Gaze for Personalised Saliency Prediction
por: Strohm, Florian, et al.
Publicado: (2024)
por: Strohm, Florian, et al.
Publicado: (2024)
Ejemplares similares
-
OLViT: Multi-Modal State Tracking via Attention-Based Embeddings for Video-Grounded Dialog
por: Abdessaied, Adnen, et al.
Publicado: (2024) -
V$^2$Dial: Unification of Video and Visual Dialog via Multimodal Experts
por: Abdessaied, Adnen, et al.
Publicado: (2025) -
ActionDiffusion: An Action-aware Diffusion Model for Procedure Planning in Instructional Videos
por: Shi, Lei, et al.
Publicado: (2024) -
CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning
por: Shi, Lei, et al.
Publicado: (2025) -
VSA4VQA: Scaling a Vector Symbolic Architecture to Visual Question Answering on Natural Images
por: Penzkofer, Anna, et al.
Publicado: (2024)