GHOST: Grounded Human Motion Generation with Open Vocabulary Scene-and-Text Contexts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Milacski, Zoltán Á., Niinuma, Koichiro, Kawamura, Ryosuke, de la Torre, Fernando, Jeni, László A. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CoGS: Controllable Gaussian Splatting
par: Yu, Heng, et autres
Publié: (2023)
par: Yu, Heng, et autres
Publié: (2023)
Gaussian Splatting Lucas-Kanade
par: Xie, Liuyue, et autres
Publié: (2024)
par: Xie, Liuyue, et autres
Publié: (2024)
Don't Look Twice: Faster Video Transformers with Run-Length Tokenization
par: Choudhury, Rohan, et autres
Publié: (2024)
par: Choudhury, Rohan, et autres
Publié: (2024)
SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion
par: Cho, Jungbin, et autres
Publié: (2025)
par: Cho, Jungbin, et autres
Publié: (2025)
Occlusion Sensitivity Analysis with Augmentation Subspace Perturbation in Deep Feature Space
par: Valois, Pedro, et autres
Publié: (2023)
par: Valois, Pedro, et autres
Publié: (2023)
Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time Training
par: Zhou, Yunjiao, et autres
Publié: (2025)
par: Zhou, Yunjiao, et autres
Publié: (2025)
OnlineHMR: Video-based Online World-Grounded Human Mesh Recovery
par: Zhao, Yiwen, et autres
Publié: (2026)
par: Zhao, Yiwen, et autres
Publié: (2026)
DiSRT-In-Bed: Diffusion-Based Sim-to-Real Transfer Framework for In-Bed Human Mesh Recovery
par: Gao, Jing, et autres
Publié: (2025)
par: Gao, Jing, et autres
Publié: (2025)
Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning
par: Li, Hongxi, et autres
Publié: (2026)
par: Li, Hongxi, et autres
Publié: (2026)
GHOST: Ground-projected Hypotheses from Observed Structure-from-Motion Trajectories
par: Frelek, Tomasz, et autres
Publié: (2026)
par: Frelek, Tomasz, et autres
Publié: (2026)
Open-Vocabulary Indoor Object Grounding with 3D Hierarchical Scene Graph
par: Linok, Sergey, et autres
Publié: (2025)
par: Linok, Sergey, et autres
Publié: (2025)
Generating Human Interaction Motions in Scenes with Text Control
par: Yi, Hongwei, et autres
Publié: (2024)
par: Yi, Hongwei, et autres
Publié: (2024)
Open-Vocabulary Functional 3D Human-Scene Interaction Generation
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
Open-Vocabulary Domain Generalization in Urban-Scene Segmentation
par: Zhao, Dong, et autres
Publié: (2026)
par: Zhao, Dong, et autres
Publié: (2026)
Through the Curved Cover: Synthesizing Cover Aberrated Scenes with Refractive Field
par: Xie, Liuyue, et autres
Publié: (2024)
par: Xie, Liuyue, et autres
Publié: (2024)
SCORE: Scene Context Matters in Open-Vocabulary Remote Sensing Instance Segmentation
par: Huang, Shiqi, et autres
Publié: (2025)
par: Huang, Shiqi, et autres
Publié: (2025)
Generating Human Motion in 3D Scenes from Text Descriptions
par: Cen, Zhi, et autres
Publié: (2024)
par: Cen, Zhi, et autres
Publié: (2024)
Classifying the Unknown: In-Context Learning for Open-Vocabulary Text and Symbol Recognition
par: Simon, Tom, et autres
Publié: (2025)
par: Simon, Tom, et autres
Publié: (2025)
AlignDiff: Learning Physically-Grounded Camera Alignment via Diffusion
par: Xie, Liuyue, et autres
Publié: (2025)
par: Xie, Liuyue, et autres
Publié: (2025)
4Real: Towards Photorealistic 4D Scene Generation via Video Diffusion Models
par: Yu, Heng, et autres
Publié: (2024)
par: Yu, Heng, et autres
Publié: (2024)
CAGS: Open-Vocabulary 3D Scene Understanding with Context-Aware Gaussian Splatting
par: Sun, Wei, et autres
Publié: (2025)
par: Sun, Wei, et autres
Publié: (2025)
Scalable Dynamic Origin-Destination Demand Estimation Enhanced by High-Resolution Satellite Imagery Data
par: Liu, Jiachao, et autres
Publié: (2025)
par: Liu, Jiachao, et autres
Publié: (2025)
Open-Vocabulary Scene Text Recognition via Pseudo-Image Labeling and Margin Loss
par: Ren, Xuhua, et autres
Publié: (2024)
par: Ren, Xuhua, et autres
Publié: (2024)
OpenScan: A Benchmark for Generalized Open-Vocabulary 3D Scene Understanding
par: Zhao, Youjun, et autres
Publié: (2024)
par: Zhao, Youjun, et autres
Publié: (2024)
Open Vocabulary Semantic Scene Sketch Understanding
par: Bourouis, Ahmed, et autres
Publié: (2023)
par: Bourouis, Ahmed, et autres
Publié: (2023)
ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
par: Peng, Cihang, et autres
Publié: (2025)
par: Peng, Cihang, et autres
Publié: (2025)
SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation
par: Luo, Jun, et autres
Publié: (2026)
par: Luo, Jun, et autres
Publié: (2026)
3D-LFM: Lifting Foundation Model
par: Dabhi, Mosam, et autres
Publié: (2023)
par: Dabhi, Mosam, et autres
Publié: (2023)
Text-controlled Motion Mamba: Text-Instructed Temporal Grounding of Human Motion
par: Wang, Xinghan, et autres
Publié: (2024)
par: Wang, Xinghan, et autres
Publié: (2024)
Multi-Camera Self-Calibration in Sports Motion Capture: Leveraging Human and Stick Poses
par: Yang, Fan, et autres
Publié: (2026)
par: Yang, Fan, et autres
Publié: (2026)
Beyond Bare Queries: Open-Vocabulary Object Grounding with 3D Scene Graph
par: Linok, Sergey, et autres
Publié: (2024)
par: Linok, Sergey, et autres
Publié: (2024)
Interaction-Centric Knowledge Infusion and Transfer for Open-Vocabulary Scene Graph Generation
par: Li, Lin, et autres
Publié: (2025)
par: Li, Lin, et autres
Publié: (2025)
Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes
par: Zhou, Changqing, et autres
Publié: (2026)
par: Zhou, Changqing, et autres
Publié: (2026)
Unified Spherical Frontend: Learning Rotation-Equivariant Representations of Spherical Images from Any Camera
par: Yu, Mukai, et autres
Publié: (2025)
par: Yu, Mukai, et autres
Publié: (2025)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
par: Tai, Hanchen, et autres
Publié: (2024)
par: Tai, Hanchen, et autres
Publié: (2024)
Affogato: Learning Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale
par: Lee, Junha, et autres
Publié: (2025)
par: Lee, Junha, et autres
Publié: (2025)
Textual Decomposition Then Sub-motion-space Scattering for Open-Vocabulary Motion Generation
par: Fan, Ke, et autres
Publié: (2024)
par: Fan, Ke, et autres
Publié: (2024)
RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection
par: Chen, Fangyi, et autres
Publié: (2024)
par: Chen, Fangyi, et autres
Publié: (2024)
Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?
par: Mütze, Annika, et autres
Publié: (2025)
par: Mütze, Annika, et autres
Publié: (2025)
CAGE-SGG: Counterfactual Active Graph Evidence for Open-Vocabulary Scene Graph Generation
par: Guang, Suiyang, et autres
Publié: (2026)
par: Guang, Suiyang, et autres
Publié: (2026)
Documents similaires
-
CoGS: Controllable Gaussian Splatting
par: Yu, Heng, et autres
Publié: (2023) -
Gaussian Splatting Lucas-Kanade
par: Xie, Liuyue, et autres
Publié: (2024) -
Don't Look Twice: Faster Video Transformers with Run-Length Tokenization
par: Choudhury, Rohan, et autres
Publié: (2024) -
SceneAdapt: Scene-aware Adaptation of Human Motion Diffusion
par: Cho, Jungbin, et autres
Publié: (2025) -
Occlusion Sensitivity Analysis with Augmentation Subspace Perturbation in Deep Feature Space
par: Valois, Pedro, et autres
Publié: (2023)