TV-Dialogue: Crafting Theme-Aware Video Dialogues with Immersive Interaction
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Sai, Ma, Fan, Li, Xinyi, Fan, Hehe, Wu, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
InfiniDreamer: Arbitrarily Long Human Motion Generation via Segment Score Distillation
di: Zhuo, Wenjie, et al.
Pubblicazione: (2024)
di: Zhuo, Wenjie, et al.
Pubblicazione: (2024)
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
di: Yang, Zhenyu, et al.
Pubblicazione: (2025)
di: Yang, Zhenyu, et al.
Pubblicazione: (2025)
BVINet: Unlocking Blind Video Inpainting with Zero Annotations
di: Wu, Zhiliang, et al.
Pubblicazione: (2025)
di: Wu, Zhiliang, et al.
Pubblicazione: (2025)
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing
di: Yang, Xiangpeng, et al.
Pubblicazione: (2025)
di: Yang, Xiangpeng, et al.
Pubblicazione: (2025)
VividDreamer: Invariant Score Distillation For Hyper-Realistic Text-to-3D Generation
di: Zhuo, Wenjie, et al.
Pubblicazione: (2024)
di: Zhuo, Wenjie, et al.
Pubblicazione: (2024)
Prompt-Aware Controllable Shadow Removal
di: Chen, Kerui, et al.
Pubblicazione: (2025)
di: Chen, Kerui, et al.
Pubblicazione: (2025)
MMAD: Multi-label Micro-Action Detection in Videos
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing
di: Yang, Xiangpeng, et al.
Pubblicazione: (2024)
di: Yang, Xiangpeng, et al.
Pubblicazione: (2024)
DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection
di: Qi, Hongyuan, et al.
Pubblicazione: (2026)
di: Qi, Hongyuan, et al.
Pubblicazione: (2026)
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
di: Li, Haoyuan, et al.
Pubblicazione: (2026)
di: Li, Haoyuan, et al.
Pubblicazione: (2026)
Dialogue Director: Bridging the Gap in Dialogue Visualization for Multimodal Storytelling
di: Zhang, Min, et al.
Pubblicazione: (2024)
di: Zhang, Min, et al.
Pubblicazione: (2024)
TransNormal: Dense Visual Semantics for Diffusion-based Transparent Object Normal Estimation
di: Li, Mingwei, et al.
Pubblicazione: (2026)
di: Li, Mingwei, et al.
Pubblicazione: (2026)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
TDRI: Two-Phase Dialogue Refinement and Co-Adaptation for Interactive Image Generation
di: Feng, Yuheng, et al.
Pubblicazione: (2025)
di: Feng, Yuheng, et al.
Pubblicazione: (2025)
Scaling Video Understanding via Compact Latent Multi-Agent Collaboration
di: Chen, Kerui, et al.
Pubblicazione: (2026)
di: Chen, Kerui, et al.
Pubblicazione: (2026)
HeadStudio: Text to Animatable Head Avatars with 3D Gaussian Splatting
di: Zhou, Zhenglin, et al.
Pubblicazione: (2024)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2024)
DAT: Dialogue-Aware Transformer with Modality-Group Fusion for Human Engagement Estimation
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval
di: Han, Ning, et al.
Pubblicazione: (2025)
di: Han, Ning, et al.
Pubblicazione: (2025)
DeMoGen: Towards Decompositional Human Motion Generation with Energy-Based Diffusion Models
di: Zhang, Jianrong, et al.
Pubblicazione: (2025)
di: Zhang, Jianrong, et al.
Pubblicazione: (2025)
EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent Space
di: Zhang, Jianrong, et al.
Pubblicazione: (2024)
di: Zhang, Jianrong, et al.
Pubblicazione: (2024)
Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues
di: Hou, Wenjin, et al.
Pubblicazione: (2026)
di: Hou, Wenjin, et al.
Pubblicazione: (2026)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
di: Tong, Wenwen, et al.
Pubblicazione: (2025)
di: Tong, Wenwen, et al.
Pubblicazione: (2025)
Hand-Centric Motion Refinement for 3D Hand-Object Interaction via Hierarchical Spatial-Temporal Modeling
di: Hao, Yuze, et al.
Pubblicazione: (2024)
di: Hao, Yuze, et al.
Pubblicazione: (2024)
WordCraft: Interactive Artistic Typography with Attention Awareness and Noise Blending
di: Wang, Zhe, et al.
Pubblicazione: (2025)
di: Wang, Zhe, et al.
Pubblicazione: (2025)
Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
ThemeStation: Generating Theme-Aware 3D Assets from Few Exemplars
di: Wang, Zhenwei, et al.
Pubblicazione: (2024)
di: Wang, Zhenwei, et al.
Pubblicazione: (2024)
Reflective Dialogue between Teacher and Solver Agents for Video Question Answering
di: Murakawa, Takuya, et al.
Pubblicazione: (2026)
di: Murakawa, Takuya, et al.
Pubblicazione: (2026)
EarthDial: Turning Multi-sensory Earth Observations to Interactive Dialogues
di: Soni, Sagar, et al.
Pubblicazione: (2024)
di: Soni, Sagar, et al.
Pubblicazione: (2024)
Generating Dialogues from Egocentric Instructional Videos for Task Assistance: Dataset, Method and Benchmark
di: Aggarwal, Lavisha, et al.
Pubblicazione: (2025)
di: Aggarwal, Lavisha, et al.
Pubblicazione: (2025)
ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
MA-Bench: Towards Fine-grained Micro-Action Understanding
di: Li, Kun, et al.
Pubblicazione: (2026)
di: Li, Kun, et al.
Pubblicazione: (2026)
ShoulderShot: Generating Over-the-Shoulder Dialogue Videos
di: Zhang, Yuang, et al.
Pubblicazione: (2025)
di: Zhang, Yuang, et al.
Pubblicazione: (2025)
Twin Co-Adaptive Dialogue for Progressive Image Generation
di: Wang, Jianhui, et al.
Pubblicazione: (2025)
di: Wang, Jianhui, et al.
Pubblicazione: (2025)
A Video-grounded Dialogue Dataset and Metric for Event-driven Activities
di: Imrattanatrai, Wiradee, et al.
Pubblicazione: (2025)
di: Imrattanatrai, Wiradee, et al.
Pubblicazione: (2025)
VIGiA: Instructional Video Guidance via Dialogue Reasoning and Retrieval
di: Glória-Silva, Diogo, et al.
Pubblicazione: (2026)
di: Glória-Silva, Diogo, et al.
Pubblicazione: (2026)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
ImViD: Immersive Volumetric Videos for Enhanced VR Engagement
di: Yang, Zhengxian, et al.
Pubblicazione: (2025)
di: Yang, Zhengxian, et al.
Pubblicazione: (2025)
Immersive Video Compression using Implicit Neural Representations
di: Kwan, Ho Man, et al.
Pubblicazione: (2024)
di: Kwan, Ho Man, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025) -
InfiniDreamer: Arbitrarily Long Human Motion Generation via Segment Score Distillation
di: Zhuo, Wenjie, et al.
Pubblicazione: (2024) -
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
di: Yang, Zhenyu, et al.
Pubblicazione: (2025) -
BVINet: Unlocking Blind Video Inpainting with Zero Annotations
di: Wu, Zhiliang, et al.
Pubblicazione: (2025) -
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing
di: Yang, Xiangpeng, et al.
Pubblicazione: (2025)