TDMM-LM: Bridging Facial Understanding and Animation via Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Song, Luchuan, Liu, Pinxin, Liu, Haiyang, Jin, Zhenchao, Tang, Yolo Yunlong, Xu, Zichong, Liang, Susan, Bi, Jing, Corso, Jason J, Xu, Chenliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Intentional Gesture: Deliver Your Intentions with Gestures for Speech
por: Liu, Pinxin, et al.
Publicado: (2025)
por: Liu, Pinxin, et al.
Publicado: (2025)
GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling
por: Liu, Pinxin, et al.
Publicado: (2025)
por: Liu, Pinxin, et al.
Publicado: (2025)
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
por: Liang, Susan, et al.
Publicado: (2026)
por: Liang, Susan, et al.
Publicado: (2026)
Adaptive Super Resolution For One-Shot Talking-Head Generation
por: Song, Luchuan, et al.
Publicado: (2024)
por: Song, Luchuan, et al.
Publicado: (2024)
Can Sound Replace Vision in LLaVA With Token Substitution?
por: Vosoughi, Ali, et al.
Publicado: (2025)
por: Vosoughi, Ali, et al.
Publicado: (2025)
TextToon: Real-Time Text Toonify Head Avatar from Single Video
por: Song, Luchuan, et al.
Publicado: (2024)
por: Song, Luchuan, et al.
Publicado: (2024)
Generative AI for Cel-Animation: A Survey
por: Tang, Yolo Y., et al.
Publicado: (2025)
por: Tang, Yolo Y., et al.
Publicado: (2025)
Tri$^{2}$-plane: Thinking Head Avatar via Feature Pyramid
por: Song, Luchuan, et al.
Publicado: (2024)
por: Song, Luchuan, et al.
Publicado: (2024)
MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness
por: Tang, Yolo Y., et al.
Publicado: (2025)
por: Tang, Yolo Y., et al.
Publicado: (2025)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
When to Think and When to Look: Uncertainty-Guided Lookback
por: Bi, Jing, et al.
Publicado: (2025)
por: Bi, Jing, et al.
Publicado: (2025)
EAGLE: Egocentric AGgregated Language-video Engine
por: Bi, Jing, et al.
Publicado: (2024)
por: Bi, Jing, et al.
Publicado: (2024)
GaussianStyle: Gaussian Head Avatar via StyleGAN
por: Liu, Pinxin, et al.
Publicado: (2024)
por: Liu, Pinxin, et al.
Publicado: (2024)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
por: Hua, Hang, et al.
Publicado: (2024)
por: Hua, Hang, et al.
Publicado: (2024)
Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning
por: Tan, Zhangyun, et al.
Publicado: (2026)
por: Tan, Zhangyun, et al.
Publicado: (2026)
Video Understanding with Large Language Models: A Survey
por: Tang, Yolo Y., et al.
Publicado: (2023)
por: Tang, Yolo Y., et al.
Publicado: (2023)
CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity
por: Bi, Jing, et al.
Publicado: (2025)
por: Bi, Jing, et al.
Publicado: (2025)
$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion
por: Bi, Jing, et al.
Publicado: (2025)
por: Bi, Jing, et al.
Publicado: (2025)
LaunchpadGPT: Language Model as Music Visualization Designer on Launchpad
por: Xu, Siting, et al.
Publicado: (2023)
por: Xu, Siting, et al.
Publicado: (2023)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
por: Tang, Yunlong, et al.
Publicado: (2025)
por: Tang, Yunlong, et al.
Publicado: (2025)
FreSca: Scaling in Frequency Space Enhances Diffusion Models
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
Free-viewpoint Human Animation with Pose-correlated Reference Selection
por: Hong, Fa-Ting, et al.
Publicado: (2024)
por: Hong, Fa-Ting, et al.
Publicado: (2024)
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
por: Tang, Yolo Y., et al.
Publicado: (2025)
por: Tang, Yolo Y., et al.
Publicado: (2025)
Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning (v1)
por: Bi, Jing, et al.
Publicado: (2025)
por: Bi, Jing, et al.
Publicado: (2025)
What to Do Next? Memorizing skills from Egocentric Instructional Video
por: Bi, Jing, et al.
Publicado: (2025)
por: Bi, Jing, et al.
Publicado: (2025)
Unveiling Visual Perception in Language Models: An Attention Head Analysis Approach
por: Bi, Jing, et al.
Publicado: (2024)
por: Bi, Jing, et al.
Publicado: (2024)
ZeroSep: Separate Anything in Audio with Zero Training
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
StreamME: Simplify 3D Gaussian Avatar within Live Stream
por: Song, Luchuan, et al.
Publicado: (2025)
por: Song, Luchuan, et al.
Publicado: (2025)
Harnessing the Computation Redundancy in ViTs to Boost Adversarial Transferability
por: Liu, Jiani, et al.
Publicado: (2025)
por: Liu, Jiani, et al.
Publicado: (2025)
Scaling Concept With Text-Guided Diffusion Models
por: Huang, Chao, et al.
Publicado: (2024)
por: Huang, Chao, et al.
Publicado: (2024)
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
por: Tang, Yolo Y., et al.
Publicado: (2025)
por: Tang, Yolo Y., et al.
Publicado: (2025)
VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
por: Tang, Yolo Y., et al.
Publicado: (2024)
por: Tang, Yolo Y., et al.
Publicado: (2024)
Do More Details Always Introduce More Hallucinations in LVLM-based Image Captioning?
por: Feng, Mingqian, et al.
Publicado: (2024)
por: Feng, Mingqian, et al.
Publicado: (2024)
Kubrick: Multimodal Agent Collaborations for Synthetic Video Generation
por: He, Liu, et al.
Publicado: (2024)
por: He, Liu, et al.
Publicado: (2024)
ACTLLM: Action Consistency Tuned Large Language Model
por: Bi, Jing, et al.
Publicado: (2025)
por: Bi, Jing, et al.
Publicado: (2025)
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
por: Tang, Yolo Yunlong, et al.
Publicado: (2022)
por: Tang, Yolo Yunlong, et al.
Publicado: (2022)
KMTalk: Speech-Driven 3D Facial Animation with Key Motion Embedding
por: Xu, Zhihao, et al.
Publicado: (2024)
por: Xu, Zhihao, et al.
Publicado: (2024)
Learning to Transform Dynamically for Better Adversarial Transferability
por: Zhu, Rongyi, et al.
Publicado: (2024)
por: Zhu, Rongyi, et al.
Publicado: (2024)
LSF-Animation: Label-Free Speech-Driven Facial Animation via Implicit Feature Representation
por: Lu, Xin, et al.
Publicado: (2025)
por: Lu, Xin, et al.
Publicado: (2025)
Ejemplares similares
-
Intentional Gesture: Deliver Your Intentions with Gestures for Speech
por: Liu, Pinxin, et al.
Publicado: (2025) -
GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling
por: Liu, Pinxin, et al.
Publicado: (2025) -
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
por: Liang, Susan, et al.
Publicado: (2026) -
Adaptive Super Resolution For One-Shot Talking-Head Generation
por: Song, Luchuan, et al.
Publicado: (2024) -
Can Sound Replace Vision in LLaVA With Token Substitution?
por: Vosoughi, Ali, et al.
Publicado: (2025)