HMVLM: Human Motion-Vision-Lanuage Model via MoE LoRA
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Lei, Ye, Yongjing, Xia, Shihong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MRD: Using Physically Based Differentiable Rendering to Probe Vision Models for 3D Scene Understanding
par: Beilharz, Benjamin, et autres
Publié: (2025)
par: Beilharz, Benjamin, et autres
Publié: (2025)
Consistent Zero-shot 3D Texture Synthesis Using Geometry-aware Diffusion and Temporal Video Models
par: Kang, Donggoo, et autres
Publié: (2025)
par: Kang, Donggoo, et autres
Publié: (2025)
IDOL: Instant Photorealistic 3D Human Creation from a Single Image
par: Zhuang, Yiyu, et autres
Publié: (2024)
par: Zhuang, Yiyu, et autres
Publié: (2024)
Appearance-Invariant Detection of Suggestive Motion via Laban Movement Descriptors on SMPL Skeletons
par: Ahn, Jaehoon, et autres
Publié: (2026)
par: Ahn, Jaehoon, et autres
Publié: (2026)
3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model
par: Ko, Hyun-kyu, et autres
Publié: (2026)
par: Ko, Hyun-kyu, et autres
Publié: (2026)
ROI-GS: Interest-based Local Quality 3D Gaussian Splatting
par: Bui, Quoc-Anh, et autres
Publié: (2025)
par: Bui, Quoc-Anh, et autres
Publié: (2025)
ROI-NeRFs: Hi-Fi Visualization of Objects of Interest within a Scene by NeRFs Composition
par: Bui, Quoc-Anh, et autres
Publié: (2025)
par: Bui, Quoc-Anh, et autres
Publié: (2025)
3DGEER: 3D Gaussian Rendering Made Exact and Efficient for Generic Cameras
par: Huang, Zixun, et autres
Publié: (2025)
par: Huang, Zixun, et autres
Publié: (2025)
Generating 3D Terrain with 2D Cellular Automata
par: Fachada, Nuno, et autres
Publié: (2024)
par: Fachada, Nuno, et autres
Publié: (2024)
Force-Aware 3D Contact Modeling for Stable Grasp Generation
par: Chen, Zhuo, et autres
Publié: (2025)
par: Chen, Zhuo, et autres
Publié: (2025)
GSEdit: Efficient Text-Guided Editing of 3D Objects via Gaussian Splatting
par: Palandra, Francesco, et autres
Publié: (2024)
par: Palandra, Francesco, et autres
Publié: (2024)
Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
Image-based Facial Rig Inversion
par: Yang, Tianxiang, et autres
Publié: (2025)
par: Yang, Tianxiang, et autres
Publié: (2025)
SSD-GS: Scattering and Shadow Decomposition for Relightable 3D Gaussian Splatting
par: Zheng, Iris, et autres
Publié: (2026)
par: Zheng, Iris, et autres
Publié: (2026)
See-through: Single-image Layer Decomposition for Anime Characters
par: Lin, Jian, et autres
Publié: (2026)
par: Lin, Jian, et autres
Publié: (2026)
MSGS: Multispectral 3D Gaussian Splatting
par: Zheng, Iris, et autres
Publié: (2026)
par: Zheng, Iris, et autres
Publié: (2026)
Gaussian Splatting: 3D Reconstruction and Novel View Synthesis, a Review
par: Dalal, Anurag, et autres
Publié: (2024)
par: Dalal, Anurag, et autres
Publié: (2024)
DUDF: Differentiable Unsigned Distance Fields with Hyperbolic Scaling
par: Fainstein, Miguel, et autres
Publié: (2024)
par: Fainstein, Miguel, et autres
Publié: (2024)
MORQA: Benchmarking Evaluation Metrics for Medical Open-Ended Question Answering
par: Yim, Wen-wai, et autres
Publié: (2025)
par: Yim, Wen-wai, et autres
Publié: (2025)
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
par: Viveiros, André G., et autres
Publié: (2025)
par: Viveiros, André G., et autres
Publié: (2025)
TSPE-GS: Probabilistic Depth Extraction for Semi-Transparent Surface Reconstruction via 3D Gaussian Splatting
par: Xu, Zhiyuan, et autres
Publié: (2025)
par: Xu, Zhiyuan, et autres
Publié: (2025)
Generating Diverse Agricultural Data for Vision-Based Farming Applications
par: Cieslak, Mikolaj, et autres
Publié: (2024)
par: Cieslak, Mikolaj, et autres
Publié: (2024)
PrismAvatar: Real-time animated 3D neural head avatars on edge devices
par: Raina, Prashant, et autres
Publié: (2025)
par: Raina, Prashant, et autres
Publié: (2025)
TexTile: A Differentiable Metric for Texture Tileability
par: Rodriguez-Pardo, Carlos, et autres
Publié: (2024)
par: Rodriguez-Pardo, Carlos, et autres
Publié: (2024)
HuMoCon: Concept Discovery for Human Motion Understanding
par: Fang, Qihang, et autres
Publié: (2025)
par: Fang, Qihang, et autres
Publié: (2025)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
par: Fu, Tianyu, et autres
Publié: (2024)
par: Fu, Tianyu, et autres
Publié: (2024)
TensLoRA: Tensor Alternatives for Low-Rank Adaptation
par: Marmoret, Axel, et autres
Publié: (2025)
par: Marmoret, Axel, et autres
Publié: (2025)
Context-Dependent Affordance Computation in Vision-Language Models
par: Farzulla, Murad
Publié: (2026)
par: Farzulla, Murad
Publié: (2026)
The MSR-Video to Text Dataset with Clean Annotations
par: Chen, Haoran, et autres
Publié: (2021)
par: Chen, Haoran, et autres
Publié: (2021)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
Skullptor: High Fidelity 3D Head Reconstruction in Seconds with Multi-View Normal Prediction
par: Artru, Noé, et autres
Publié: (2026)
par: Artru, Noé, et autres
Publié: (2026)
Objaverse++: Curated 3D Object Dataset with Quality Annotations
par: Lin, Chendi, et autres
Publié: (2025)
par: Lin, Chendi, et autres
Publié: (2025)
Unpacking Hateful Memes: Presupposed Context and False Claims
par: Cai, Weibin, et autres
Publié: (2025)
par: Cai, Weibin, et autres
Publié: (2025)
SpectralGaussians: Semantic, spectral 3D Gaussian splatting for multi-spectral scene representation, visualization and analysis
par: Sinha, Saptarshi Neil, et autres
Publié: (2024)
par: Sinha, Saptarshi Neil, et autres
Publié: (2024)
Learning Association via Track-Detection Matching for Multi-Object Tracking
par: Adžemović, Momir
Publié: (2025)
par: Adžemović, Momir
Publié: (2025)
LAESI: Leaf Area Estimation with Synthetic Imagery
par: Kałużny, Jacek, et autres
Publié: (2024)
par: Kałużny, Jacek, et autres
Publié: (2024)
Visual-Text Cross Alignment: Refining the Similarity Score in Vision-Language Models
par: Li, Jinhao, et autres
Publié: (2024)
par: Li, Jinhao, et autres
Publié: (2024)
Pro-DG: Procedural Diffusion Guidance for Architectural Facade Generation
par: Plocharski, Aleksander, et autres
Publié: (2025)
par: Plocharski, Aleksander, et autres
Publié: (2025)
GraphTEN: Graph Enhanced Texture Encoding Network
par: Peng, Bo, et autres
Publié: (2025)
par: Peng, Bo, et autres
Publié: (2025)
SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
Documents similaires
-
MRD: Using Physically Based Differentiable Rendering to Probe Vision Models for 3D Scene Understanding
par: Beilharz, Benjamin, et autres
Publié: (2025) -
Consistent Zero-shot 3D Texture Synthesis Using Geometry-aware Diffusion and Temporal Video Models
par: Kang, Donggoo, et autres
Publié: (2025) -
IDOL: Instant Photorealistic 3D Human Creation from a Single Image
par: Zhuang, Yiyu, et autres
Publié: (2024) -
Appearance-Invariant Detection of Suggestive Motion via Laban Movement Descriptors on SMPL Skeletons
par: Ahn, Jaehoon, et autres
Publié: (2026) -
3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model
par: Ko, Hyun-kyu, et autres
Publié: (2026)