Learning Generalizable Human Motion Generator with Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mao, Yunyao, Liu, Xiaoyang, Zhou, Wengang, Lu, Zhenbo, Li, Houqiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning
par: Liu, Xiaoyang, et autres
Publié: (2024)
par: Liu, Xiaoyang, et autres
Publié: (2024)
MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition
par: Zhao, Weichao, et autres
Publié: (2024)
par: Zhao, Weichao, et autres
Publié: (2024)
Motion-aware 3D Gaussian Splatting for Efficient Dynamic Scene Reconstruction
par: Guo, Zhiyang, et autres
Publié: (2024)
par: Guo, Zhiyang, et autres
Publié: (2024)
Cross-Modal Consistency Learning for Sign Language Recognition
par: Wu, Kepeng, et autres
Publié: (2025)
par: Wu, Kepeng, et autres
Publié: (2025)
Recurrent Generic Contour-based Instance Segmentation with Progressive Learning
par: Feng, Hao, et autres
Publié: (2023)
par: Feng, Hao, et autres
Publié: (2023)
Self-Supervised Representation Learning with Spatial-Temporal Consistency for Sign Language Recognition
par: Zhao, Weichao, et autres
Publié: (2024)
par: Zhao, Weichao, et autres
Publié: (2024)
StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models
par: Liu, Keli, et autres
Publié: (2026)
par: Liu, Keli, et autres
Publié: (2026)
Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation
par: Cui, Xiao, et autres
Publié: (2025)
par: Cui, Xiao, et autres
Publié: (2025)
GaussNav: Gaussian Splatting for Visual Navigation
par: Lei, Xiaohan, et autres
Publié: (2024)
par: Lei, Xiaohan, et autres
Publié: (2024)
AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding
par: Wang, Yonghui, et autres
Publié: (2024)
par: Wang, Yonghui, et autres
Publié: (2024)
Revisiting Shadow Detection from a Vision-Language Perspective
par: Wang, Yonghui, et autres
Publié: (2026)
par: Wang, Yonghui, et autres
Publié: (2026)
Multi-Scale Invertible Neural Network for Wide-Range Variable-Rate Learned Image Compression
par: Tu, Hanyue, et autres
Publié: (2025)
par: Tu, Hanyue, et autres
Publié: (2025)
SwinShadow: Shifted Window for Ambiguous Adjacent Shadow Detection
par: Wang, Yonghui, et autres
Publié: (2024)
par: Wang, Yonghui, et autres
Publié: (2024)
DeepEraser: Deep Iterative Context Mining for Generic Text Eraser
par: Feng, Hao, et autres
Publié: (2024)
par: Feng, Hao, et autres
Publié: (2024)
Forest2Seq: Revitalizing Order Prior for Sequential Indoor Scene Synthesis
par: Sun, Qi, et autres
Publié: (2024)
par: Sun, Qi, et autres
Publié: (2024)
ScaleWeaver: Weaving Efficient Controllable T2I Generation with Multi-Scale Reference Attention
par: Liu, Keli, et autres
Publié: (2025)
par: Liu, Keli, et autres
Publié: (2025)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
par: Sun, Qi, et autres
Publié: (2024)
par: Sun, Qi, et autres
Publié: (2024)
RoFIR: Robust Fisheye Image Rectification Framework Impervious to Optical Center Deviation
par: Liao, Zhaokang, et autres
Publié: (2024)
par: Liao, Zhaokang, et autres
Publié: (2024)
Exploiting Spatial-Temporal Context for Interacting Hand Reconstruction on Monocular RGB Video
par: Zhao, Weichao, et autres
Publié: (2023)
par: Zhao, Weichao, et autres
Publié: (2023)
Video-based Sign Language Recognition without Temporal Segmentation
par: Huang, Jie, et autres
Publié: (2018)
par: Huang, Jie, et autres
Publié: (2018)
DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion Models
par: Wang, Zhendong, et autres
Publié: (2025)
par: Wang, Zhendong, et autres
Publié: (2025)
Text-Animator: Controllable Visual Text Video Generation
par: Liu, Lin, et autres
Publié: (2024)
par: Liu, Lin, et autres
Publié: (2024)
Progressive Multi-modal Conditional Prompt Tuning
par: Qiu, Xiaoyu, et autres
Publié: (2024)
par: Qiu, Xiaoyu, et autres
Publié: (2024)
Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval
par: Du, Yongchao, et autres
Publié: (2024)
par: Du, Yongchao, et autres
Publié: (2024)
LaneTCA: Enhancing Video Lane Detection with Temporal Context Aggregation
par: Zhou, Keyi, et autres
Publié: (2024)
par: Zhou, Keyi, et autres
Publié: (2024)
Instance-aware Exploration-Verification-Exploitation for Instance ImageGoal Navigation
par: Lei, Xiaohan, et autres
Publié: (2024)
par: Lei, Xiaohan, et autres
Publié: (2024)
Robust Multimodal Large Language Models Against Modality Conflict
par: Zhang, Zongmeng, et autres
Publié: (2025)
par: Zhang, Zongmeng, et autres
Publié: (2025)
Scaling up Multimodal Pre-training for Sign Language Understanding
par: Zhou, Wengang, et autres
Publié: (2024)
par: Zhou, Wengang, et autres
Publié: (2024)
Self-Classification Enhancement and Correction for Weakly Supervised Object Detection
par: Yin, Yufei, et autres
Publié: (2025)
par: Yin, Yufei, et autres
Publié: (2025)
Rethinking Long-tailed Dataset Distillation: A Uni-Level Framework with Unbiased Recovery and Relabeling
par: Cui, Xiao, et autres
Publié: (2025)
par: Cui, Xiao, et autres
Publié: (2025)
Structural Action Transformer for 3D Dexterous Manipulation
par: Lei, Xiaohan, et autres
Publié: (2026)
par: Lei, Xiaohan, et autres
Publié: (2026)
SEDS: Semantically Enhanced Dual-Stream Encoder for Sign Language Retrieval
par: Jiang, Longtao, et autres
Publié: (2024)
par: Jiang, Longtao, et autres
Publié: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
par: Luan, Bozhi, et autres
Publié: (2025)
par: Luan, Bozhi, et autres
Publié: (2025)
Uni-Sign: Toward Unified Sign Language Understanding at Scale
par: Li, Zecheng, et autres
Publié: (2025)
par: Li, Zecheng, et autres
Publié: (2025)
Semantic Image Synthesis via Diffusion Models
par: Zhou, Wengang, et autres
Publié: (2022)
par: Zhou, Wengang, et autres
Publié: (2022)
StreetSurfGS: Scalable Urban Street Surface Reconstruction with Planar-based Gaussian Splatting
par: Cui, Xiao, et autres
Publié: (2024)
par: Cui, Xiao, et autres
Publié: (2024)
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
par: Luan, Bozhi, et autres
Publié: (2024)
par: Luan, Bozhi, et autres
Publié: (2024)
Mitigating Hallucination in VideoLLMs via Temporal-Aware Activation Engineering
par: Cai, Jianfeng, et autres
Publié: (2025)
par: Cai, Jianfeng, et autres
Publié: (2025)
Learning Efficient and Generalizable Human Representation with Human Gaussian Model
par: Liu, Yifan, et autres
Publié: (2025)
par: Liu, Yifan, et autres
Publié: (2025)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
par: Xiong, Junyu, et autres
Publié: (2025)
par: Xiong, Junyu, et autres
Publié: (2025)
Documents similaires
-
MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning
par: Liu, Xiaoyang, et autres
Publié: (2024) -
MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition
par: Zhao, Weichao, et autres
Publié: (2024) -
Motion-aware 3D Gaussian Splatting for Efficient Dynamic Scene Reconstruction
par: Guo, Zhiyang, et autres
Publié: (2024) -
Cross-Modal Consistency Learning for Sign Language Recognition
par: Wu, Kepeng, et autres
Publié: (2025) -
Recurrent Generic Contour-based Instance Segmentation with Progressive Learning
par: Feng, Hao, et autres
Publié: (2023)