RITA: A Real-time Interactive Talking Avatars Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cheng, Wuxinlin, Wan, Cheng, Cao, Yupeng, Chen, Sihan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
par: Sun, Zhiyao, et autres
Publié: (2025)
par: Sun, Zhiyao, et autres
Publié: (2025)
Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation
par: Ki, Taekyung, et autres
Publié: (2026)
par: Ki, Taekyung, et autres
Publié: (2026)
Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation
par: Park, Se Jin, et autres
Publié: (2024)
par: Park, Se Jin, et autres
Publié: (2024)
OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions
par: Luo, Cheng, et autres
Publié: (2025)
par: Luo, Cheng, et autres
Publié: (2025)
Negative Shanshui: Real-time Interactive Ink Painting Synthesis
par: Zhou, Aven-Le
Publié: (2025)
par: Zhou, Aven-Le
Publié: (2025)
Transfer Learning-based Real-time Handgun Detection
par: Elmir, Youssef
Publié: (2023)
par: Elmir, Youssef
Publié: (2023)
See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm
par: Zhao, Haoyu, et autres
Publié: (2025)
par: Zhao, Haoyu, et autres
Publié: (2025)
ImageTalk: Designing a Multimodal AAC Text Generation System Driven by Image Recognition and Natural Language Generation
par: Yang, Boyin, et autres
Publié: (2025)
par: Yang, Boyin, et autres
Publié: (2025)
Adaptive 3D UI Placement in Mixed Reality Using Deep Reinforcement Learning
par: Lu, Feiyu, et autres
Publié: (2025)
par: Lu, Feiyu, et autres
Publié: (2025)
T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation
par: Chen, Chieh-Yun, et autres
Publié: (2025)
par: Chen, Chieh-Yun, et autres
Publié: (2025)
How Smart Is Your GUI Agent? A Framework for the Future of Software Interaction
par: Feng, Sidong, et autres
Publié: (2026)
par: Feng, Sidong, et autres
Publié: (2026)
Yume: An Interactive World Generation Model
par: Mao, Xiaofeng, et autres
Publié: (2025)
par: Mao, Xiaofeng, et autres
Publié: (2025)
SSSUMO: Real-Time Semi-Supervised Submovement Decomposition
par: Rudakov, Evgenii, et autres
Publié: (2025)
par: Rudakov, Evgenii, et autres
Publié: (2025)
Explorer: Robust Collection of Interactable GUI Elements
par: Chaimalas, Iason, et autres
Publié: (2025)
par: Chaimalas, Iason, et autres
Publié: (2025)
SkinGEN: an Explainable Dermatology Diagnosis-to-Generation Framework with Interactive Vision-Language Models
par: Lin, Bo, et autres
Publié: (2024)
par: Lin, Bo, et autres
Publié: (2024)
Real-Time Feedback and Benchmark Dataset for Isometric Pose Evaluation
par: Jaiswal, Abhishek, et autres
Publié: (2025)
par: Jaiswal, Abhishek, et autres
Publié: (2025)
"I Can See Forever!": Evaluating Real-time VideoLLMs for Assisting Individuals with Visual Impairments
par: Zhang, Ziyi, et autres
Publié: (2025)
par: Zhang, Ziyi, et autres
Publié: (2025)
LCE: A Framework for Explainability of DNNs for Ultrasound Image Based on Concept Discovery
par: Kong, Weiji, et autres
Publié: (2024)
par: Kong, Weiji, et autres
Publié: (2024)
SelfReDepth: Self-Supervised Real-Time Depth Restoration for Consumer-Grade Sensors
par: Duarte, Alexandre, et autres
Publié: (2024)
par: Duarte, Alexandre, et autres
Publié: (2024)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
par: Wu, Hang, et autres
Publié: (2025)
par: Wu, Hang, et autres
Publié: (2025)
MOSAIC-F: A Framework for Enhancing Students' Oral Presentation Skills through Personalized Feedback
par: Becerra, Alvaro, et autres
Publié: (2025)
par: Becerra, Alvaro, et autres
Publié: (2025)
SynthoGestures: A Novel Framework for Synthetic Dynamic Hand Gesture Generation for Driving Scenarios
par: Gomaa, Amr, et autres
Publié: (2023)
par: Gomaa, Amr, et autres
Publié: (2023)
Augmenting Image Annotation: A Human-LMM Collaborative Framework for Efficient Object Selection and Label Generation
par: Zhang, He, et autres
Publié: (2025)
par: Zhang, He, et autres
Publié: (2025)
LEyes: A Lightweight Framework for Deep Learning-Based Eye Tracking using Synthetic Eye Images
par: Byrne, Sean Anthony, et autres
Publié: (2023)
par: Byrne, Sean Anthony, et autres
Publié: (2023)
Achieving Effective Virtual Reality Interactions via Acoustic Gesture Recognition based on Large Language Models
par: Zhang, Xijie, et autres
Publié: (2025)
par: Zhang, Xijie, et autres
Publié: (2025)
EmoGene: Audio-Driven Emotional 3D Talking-Head Generation
par: Wang, Wenqing, et autres
Publié: (2024)
par: Wang, Wenqing, et autres
Publié: (2024)
Real-Time Intuitive AI Drawing System for Collaboration: Enhancing Human Creativity through Formal and Contextual Intent Integration
par: Song, Jookyung, et autres
Publié: (2025)
par: Song, Jookyung, et autres
Publié: (2025)
Scene-Aware Conversational ADAS with Generative AI for Real-Time Driver Assistance
par: Han, Kyungtae, et autres
Publié: (2025)
par: Han, Kyungtae, et autres
Publié: (2025)
VISLIX: An XAI Framework for Validating Vision Models with Slice Discovery and Analysis
par: Yan, Xinyuan, et autres
Publié: (2025)
par: Yan, Xinyuan, et autres
Publié: (2025)
DiffMesh: A Motion-aware Diffusion Framework for Human Mesh Recovery from Videos
par: Zheng, Ce, et autres
Publié: (2023)
par: Zheng, Ce, et autres
Publié: (2023)
Milmer: a Framework for Multiple Instance Learning based Multimodal Emotion Recognition
par: Wang, Zaitian, et autres
Publié: (2025)
par: Wang, Zaitian, et autres
Publié: (2025)
Aria Everyday Activities Dataset
par: Lv, Zhaoyang, et autres
Publié: (2024)
par: Lv, Zhaoyang, et autres
Publié: (2024)
Sightation Counts: Leveraging Sighted User Feedback in Building a BLV-aligned Dataset of Diagram Descriptions
par: Kang, Wan Ju, et autres
Publié: (2025)
par: Kang, Wan Ju, et autres
Publié: (2025)
Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss Functions
par: Rakesh, Vineet Kumar, et autres
Publié: (2025)
par: Rakesh, Vineet Kumar, et autres
Publié: (2025)
Learning To Defer To A Population With Limited Demonstrations
par: Ramgolam, Nilesh, et autres
Publié: (2025)
par: Ramgolam, Nilesh, et autres
Publié: (2025)
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
par: Cheng, Kanzhi, et autres
Publié: (2026)
par: Cheng, Kanzhi, et autres
Publié: (2026)
GUICourse: From General Vision Language Models to Versatile GUI Agents
par: Chen, Wentong, et autres
Publié: (2024)
par: Chen, Wentong, et autres
Publié: (2024)
Multi-face emotion detection for effective Human-Robot Interaction
par: Yahyaoui, Mohamed Ala, et autres
Publié: (2025)
par: Yahyaoui, Mohamed Ala, et autres
Publié: (2025)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
par: Qin, Yujia, et autres
Publié: (2025)
par: Qin, Yujia, et autres
Publié: (2025)
ASAP: Interpretable Analysis and Summarization of AI-generated Image Patterns at Scale
par: Huang, Jinbin, et autres
Publié: (2024)
par: Huang, Jinbin, et autres
Publié: (2024)
Documents similaires
-
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
par: Sun, Zhiyao, et autres
Publié: (2025) -
Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation
par: Ki, Taekyung, et autres
Publié: (2026) -
Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation
par: Park, Se Jin, et autres
Publié: (2024) -
OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions
par: Luo, Cheng, et autres
Publié: (2025) -
Negative Shanshui: Real-time Interactive Ink Painting Synthesis
par: Zhou, Aven-Le
Publié: (2025)