Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Rui, He, Shuwei, Hu, Yifan, Li, Haizhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
di: Tian, Zeyue, et al.
Pubblicazione: (2026)
PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning
di: Zhang, Dongxu, et al.
Pubblicazione: (2026)
di: Zhang, Dongxu, et al.
Pubblicazione: (2026)
LLM-based Fusion of Multi-modal Features for Commercial Memorability Prediction
di: Pramov, Aleksandar
Pubblicazione: (2025)
di: Pramov, Aleksandar
Pubblicazione: (2025)
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2022)
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2022)
Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs
di: Mo, Wentao, et al.
Pubblicazione: (2026)
di: Mo, Wentao, et al.
Pubblicazione: (2026)
DreamStory: Open-Domain Story Visualization by LLM-Guided Multi-Subject Consistent Diffusion
di: He, Huiguo, et al.
Pubblicazione: (2024)
di: He, Huiguo, et al.
Pubblicazione: (2024)
MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding
di: Yang, Fan, et al.
Pubblicazione: (2025)
di: Yang, Fan, et al.
Pubblicazione: (2025)
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
di: Han, Jiaming, et al.
Pubblicazione: (2025)
di: Han, Jiaming, et al.
Pubblicazione: (2025)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
KAN Text to Vision? The Exploration of Kolmogorov-Arnold Networks for Multi-Scale Sequence-Based Pose Animation from Sign Language Notation
di: Du, Guanyi, et al.
Pubblicazione: (2026)
di: Du, Guanyi, et al.
Pubblicazione: (2026)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
di: Li, Zeju, et al.
Pubblicazione: (2024)
di: Li, Zeju, et al.
Pubblicazione: (2024)
MultiWay-Adapater: Adapting large-scale multi-modal models for scalable image-text retrieval
di: Long, Zijun, et al.
Pubblicazione: (2023)
di: Long, Zijun, et al.
Pubblicazione: (2023)
MM-Point: Multi-View Information-Enhanced Multi-Modal Self-Supervised 3D Point Cloud Understanding
di: Yu, Hai-Tao, et al.
Pubblicazione: (2024)
di: Yu, Hai-Tao, et al.
Pubblicazione: (2024)
Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey
di: Wang, Xiao, et al.
Pubblicazione: (2023)
di: Wang, Xiao, et al.
Pubblicazione: (2023)
CalliffusionV2: Personalized Natural Calligraphy Generation with Flexible Multi-modal Control
di: Liao, Qisheng, et al.
Pubblicazione: (2024)
di: Liao, Qisheng, et al.
Pubblicazione: (2024)
Audio Visual Segmentation Through Text Embeddings
di: Lee, Kyungbok, et al.
Pubblicazione: (2025)
di: Lee, Kyungbok, et al.
Pubblicazione: (2025)
Hierarchical Knowledge Graphs for Story Understanding in Visual Narratives
di: Chen, Yi-Chun
Pubblicazione: (2025)
di: Chen, Yi-Chun
Pubblicazione: (2025)
NativE: Multi-modal Knowledge Graph Completion in the Wild
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
Controllable Audio-Visual Viewpoint Generation from 360° Spatial Information
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline Context
di: Zheng, Sixiao, et al.
Pubblicazione: (2024)
di: Zheng, Sixiao, et al.
Pubblicazione: (2024)
Cross-modal Causal Intervention for Alzheimer's Disease Prediction
di: Jin, Yutao, et al.
Pubblicazione: (2025)
di: Jin, Yutao, et al.
Pubblicazione: (2025)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
di: Zhou, Jinxing, et al.
Pubblicazione: (2025)
di: Zhou, Jinxing, et al.
Pubblicazione: (2025)
MAVEN: Multi-modal Attention for Valence-Arousal Emotion Network
di: Ahire, Vrushank, et al.
Pubblicazione: (2025)
di: Ahire, Vrushank, et al.
Pubblicazione: (2025)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
di: Cai, Minghong, et al.
Pubblicazione: (2024)
di: Cai, Minghong, et al.
Pubblicazione: (2024)
360+x: A Panoptic Multi-modal Scene Understanding Dataset
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
di: Li, Guangyao, et al.
Pubblicazione: (2024)
di: Li, Guangyao, et al.
Pubblicazione: (2024)
Robust Fuzzy Multi-view Learning under View Conflict
di: Duan, Siyuan, et al.
Pubblicazione: (2026)
di: Duan, Siyuan, et al.
Pubblicazione: (2026)
AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive Videos
di: Hu, Jiagao, et al.
Pubblicazione: (2026)
di: Hu, Jiagao, et al.
Pubblicazione: (2026)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
di: Du, Mengfei, et al.
Pubblicazione: (2024)
di: Du, Mengfei, et al.
Pubblicazione: (2024)
A multi-purpose automatic editing system based on lecture semantics for remote education
di: Hu, Panwen, et al.
Pubblicazione: (2024)
di: Hu, Panwen, et al.
Pubblicazione: (2024)
Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs
di: Song, Dingjie, et al.
Pubblicazione: (2024)
di: Song, Dingjie, et al.
Pubblicazione: (2024)
Visual and Text Prompt Segmentation: A Novel Multi-Model Framework for Remote Sensing
di: Zi, Xing, et al.
Pubblicazione: (2025)
di: Zi, Xing, et al.
Pubblicazione: (2025)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media
di: Li, Fuhao, et al.
Pubblicazione: (2026)
di: Li, Fuhao, et al.
Pubblicazione: (2026)
SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment
di: Mao, Xinyu, et al.
Pubblicazione: (2025)
di: Mao, Xinyu, et al.
Pubblicazione: (2025)
LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture
di: Wang, Xidong, et al.
Pubblicazione: (2024)
di: Wang, Xidong, et al.
Pubblicazione: (2024)
Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR
di: Zhang, Yulong, et al.
Pubblicazione: (2025)
di: Zhang, Yulong, et al.
Pubblicazione: (2025)
Towards Unified Co-Speech Gesture Generation via Hierarchical Implicit Periodicity Learning
di: Guo, Xin, et al.
Pubblicazione: (2025)
di: Guo, Xin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
di: Tian, Zeyue, et al.
Pubblicazione: (2026) -
PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning
di: Zhang, Dongxu, et al.
Pubblicazione: (2026) -
LLM-based Fusion of Multi-modal Features for Commercial Memorability Prediction
di: Pramov, Aleksandar
Pubblicazione: (2025) -
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2022) -
Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs
di: Mo, Wentao, et al.
Pubblicazione: (2026)