SMPLest-X: Ultimate Scaling for Expressive Human Pose and Shape Estimation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yin, Wanqi, Cai, Zhongang, Wang, Ruisi, Zeng, Ailing, Wei, Chen, Sun, Qingping, Mei, Haiyi, Wang, Yanjun, Pang, Hui En, Zhang, Mingyuan, Zhang, Lei, Loy, Chen Change, Yamashita, Atsushi, Yang, Lei, Liu, Ziwei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SMPLer-X: Scaling Up Expressive Human Pose and Shape Estimation
von: Cai, Zhongang, et al.
Veröffentlicht: (2023)
von: Cai, Zhongang, et al.
Veröffentlicht: (2023)
AiOS: All-in-One-Stage Expressive Human Pose and Shape Estimation
von: Sun, Qingping, et al.
Veröffentlicht: (2024)
von: Sun, Qingping, et al.
Veröffentlicht: (2024)
Holistic Evaluation of Multimodal LLMs on Spatial Intelligence
von: Cai, Zhongang, et al.
Veröffentlicht: (2025)
von: Cai, Zhongang, et al.
Veröffentlicht: (2025)
WHAC: World-grounded Humans and Cameras
von: Yin, Wanqi, et al.
Veröffentlicht: (2024)
von: Yin, Wanqi, et al.
Veröffentlicht: (2024)
Scaling Spatial Intelligence with Multimodal Foundation Models
von: Cai, Zhongang, et al.
Veröffentlicht: (2025)
von: Cai, Zhongang, et al.
Veröffentlicht: (2025)
RenCon 2025: Revival of the Expressive Performance Rendering Competition
von: Zhang, Huan, et al.
Veröffentlicht: (2026)
von: Zhang, Huan, et al.
Veröffentlicht: (2026)
When Top-ranked Recommendations Fail: Modeling Multi-Granular Negative Feedback for Explainable and Robust Video Recommendation
von: Chen, Siran, et al.
Veröffentlicht: (2025)
von: Chen, Siran, et al.
Veröffentlicht: (2025)
RenderBox: Expressive Performance Rendering with Text Control
von: Zhang, Huan, et al.
Veröffentlicht: (2025)
von: Zhang, Huan, et al.
Veröffentlicht: (2025)
Multi-modal and Metadata Capture Model for Micro Video Popularity Prediction
von: Lu, Jiacheng, et al.
Veröffentlicht: (2025)
von: Lu, Jiacheng, et al.
Veröffentlicht: (2025)
VRAgent-R1: Boosting Video Recommendation with MLLM-based Agents via Reinforcement Learning
von: Chen, Siran, et al.
Veröffentlicht: (2025)
von: Chen, Siran, et al.
Veröffentlicht: (2025)
Perceptual-oriented Learned Image Compression with Dynamic Kernel
von: Fu, Nianxiang, et al.
Veröffentlicht: (2024)
von: Fu, Nianxiang, et al.
Veröffentlicht: (2024)
AdaMesh: Personalized Facial Expressions and Head Poses for Adaptive Speech-Driven 3D Facial Animation
von: Chen, Liyang, et al.
Veröffentlicht: (2023)
von: Chen, Liyang, et al.
Veröffentlicht: (2023)
Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech?
von: Kumar, Lokesh, et al.
Veröffentlicht: (2026)
von: Kumar, Lokesh, et al.
Veröffentlicht: (2026)
Talking-to-Build: How LLM-Assisted Interface Shapes Player Performance and Experience in Minecraft
von: Sun, Xin, et al.
Veröffentlicht: (2025)
von: Sun, Xin, et al.
Veröffentlicht: (2025)
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
von: Jin, Zeyu, et al.
Veröffentlicht: (2024)
von: Jin, Zeyu, et al.
Veröffentlicht: (2024)
Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation
von: Wang, Yongqi, et al.
Veröffentlicht: (2025)
von: Wang, Yongqi, et al.
Veröffentlicht: (2025)
Joint Optimization of Buffer Delay and HARQ for Video Communications
von: Cheng, Baoping, et al.
Veröffentlicht: (2024)
von: Cheng, Baoping, et al.
Veröffentlicht: (2024)
FashionDPO:Fine-tune Fashion Outfit Generation Model using Direct Preference Optimization
von: Yu, Mingzhe, et al.
Veröffentlicht: (2025)
von: Yu, Mingzhe, et al.
Veröffentlicht: (2025)
LLaQo: Towards a Query-Based Coach in Expressive Music Performance Assessment
von: Zhang, Huan, et al.
Veröffentlicht: (2024)
von: Zhang, Huan, et al.
Veröffentlicht: (2024)
Smart Fitting Room: A One-stop Framework for Matching-aware Virtual Try-on
von: Yu, Mingzhe, et al.
Veröffentlicht: (2024)
von: Yu, Mingzhe, et al.
Veröffentlicht: (2024)
TMFNet: Two-Stream Multi-Channels Fusion Networks for Color Image Operation Chain Detection
von: Niu, Yakun, et al.
Veröffentlicht: (2024)
von: Niu, Yakun, et al.
Veröffentlicht: (2024)
Unleashing the Power of Imbalanced Modality Information for Multi-modal Knowledge Graph Completion
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
von: Yu, Wenda, et al.
Veröffentlicht: (2026)
von: Yu, Wenda, et al.
Veröffentlicht: (2026)
Cross-Modal Retrieval: A Systematic Review of Methods and Future Directions
von: Wang, Tianshi, et al.
Veröffentlicht: (2023)
von: Wang, Tianshi, et al.
Veröffentlicht: (2023)
CustomContrast: A Multilevel Contrastive Perspective For Subject-Driven Text-to-Image Customization
von: Chen, Nan, et al.
Veröffentlicht: (2024)
von: Chen, Nan, et al.
Veröffentlicht: (2024)
M3TR: Temporal Retrieval Enhanced Multi-Modal Micro-video Popularity Prediction
von: Lu, Jiacheng, et al.
Veröffentlicht: (2024)
von: Lu, Jiacheng, et al.
Veröffentlicht: (2024)
DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models
von: Xu, Siyuan, et al.
Veröffentlicht: (2026)
von: Xu, Siyuan, et al.
Veröffentlicht: (2026)
Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing
von: Zhang, Juan, et al.
Veröffentlicht: (2024)
von: Zhang, Juan, et al.
Veröffentlicht: (2024)
TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
EidetiCom: A Cross-modal Brain-Computer Semantic Communication Paradigm for Decoding Visual Perception
von: Zheng, Linfeng, et al.
Veröffentlicht: (2024)
von: Zheng, Linfeng, et al.
Veröffentlicht: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
von: Zhang, Zhenxing, et al.
Veröffentlicht: (2024)
von: Zhang, Zhenxing, et al.
Veröffentlicht: (2024)
Querying Autonomous Vehicle Point Clouds: Enhanced by 3D Object Counting with CounterNet
von: Zhang, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xiaoyu, et al.
Veröffentlicht: (2025)
On-the-Fly Object-aware Representative Point Selection in Point Cloud
von: Zhang, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xiaoyu, et al.
Veröffentlicht: (2025)
Differential Mental Disorder Detection with Psychology-Inspired Multimodal Stimuli
von: Zhou, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Zhou, Zhiyuan, et al.
Veröffentlicht: (2026)
Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2026)
von: Zhang, Zhicheng, et al.
Veröffentlicht: (2026)
Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing
von: Li, Yanjun, et al.
Veröffentlicht: (2025)
von: Li, Yanjun, et al.
Veröffentlicht: (2025)
The Quest for Generalizable Motion Generation: Data, Model, and Evaluation
von: Lin, Jing, et al.
Veröffentlicht: (2025)
von: Lin, Jing, et al.
Veröffentlicht: (2025)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
von: Huang, Qiaochu, et al.
Veröffentlicht: (2024)
von: Huang, Qiaochu, et al.
Veröffentlicht: (2024)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
von: Zhang, Beiyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Beiyuan, et al.
Veröffentlicht: (2024)
Dynamic Interaction-Aware and Causality-Disentangled Framework for Multimodal Sentiment Analysis
von: Dong, Guangyuan, et al.
Veröffentlicht: (2026)
von: Dong, Guangyuan, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SMPLer-X: Scaling Up Expressive Human Pose and Shape Estimation
von: Cai, Zhongang, et al.
Veröffentlicht: (2023) -
AiOS: All-in-One-Stage Expressive Human Pose and Shape Estimation
von: Sun, Qingping, et al.
Veröffentlicht: (2024) -
Holistic Evaluation of Multimodal LLMs on Spatial Intelligence
von: Cai, Zhongang, et al.
Veröffentlicht: (2025) -
WHAC: World-grounded Humans and Cameras
von: Yin, Wanqi, et al.
Veröffentlicht: (2024) -
Scaling Spatial Intelligence with Multimodal Foundation Models
von: Cai, Zhongang, et al.
Veröffentlicht: (2025)