Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Thomas, Xavier, Lim, Youngsun, Srinivasan, Ananya, Zheng, Audrey, Ghadiyaram, Deepti |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What's in a Latent? Leveraging Diffusion Latent Space for Domain Generalization
par: Thomas, Xavier, et autres
Publié: (2025)
par: Thomas, Xavier, et autres
Publié: (2025)
FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models
par: Lim, Youngsun, et autres
Publié: (2026)
par: Lim, Youngsun, et autres
Publié: (2026)
$\textit{Revelio}$: Interpreting and leveraging semantic information in diffusion models
par: Kim, Dahye, et autres
Publié: (2024)
par: Kim, Dahye, et autres
Publié: (2024)
Concept Steerers: Leveraging K-Sparse Autoencoders for Test-Time Controllable Generations
par: Kim, Dahye, et autres
Publié: (2025)
par: Kim, Dahye, et autres
Publié: (2025)
Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance
par: Qiu, Jason, et autres
Publié: (2026)
par: Qiu, Jason, et autres
Publié: (2026)
A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning
par: Chen, Tianle, et autres
Publié: (2026)
par: Chen, Tianle, et autres
Publié: (2026)
Progressive Prompt Detailing for Improved Alignment in Text-to-Image Generative Models
par: Saichandran, Ketan Suhaas, et autres
Publié: (2025)
par: Saichandran, Ketan Suhaas, et autres
Publié: (2025)
Improving Physical Object State Representation in Text-to-Image Generative Systems
par: Chen, Tianle, et autres
Publié: (2025)
par: Chen, Tianle, et autres
Publié: (2025)
Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs
par: Chen, Tianle, et autres
Publié: (2025)
par: Chen, Tianle, et autres
Publié: (2025)
DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers
par: Kim, Dahye, et autres
Publié: (2026)
par: Kim, Dahye, et autres
Publié: (2026)
FuTCR: Future-Targeted Contrast and Repulsion for Continual Panoptic Segmentation
par: Ikechukwu, Nicholas, et autres
Publié: (2026)
par: Ikechukwu, Nicholas, et autres
Publié: (2026)
Addressing Image Hallucination in Text-to-Image Generation through Factual Image Retrieval
par: Lim, Youngsun, et autres
Publié: (2024)
par: Lim, Youngsun, et autres
Publié: (2024)
Action Reimagined: Text-to-Pose Video Editing for Dynamic Human Actions
par: Wang, Lan, et autres
Publié: (2024)
par: Wang, Lan, et autres
Publié: (2024)
Evaluating Image Hallucination in Text-to-Image Generation with Question-Answering
par: Lim, Youngsun, et autres
Publié: (2024)
par: Lim, Youngsun, et autres
Publié: (2024)
Tails Tell Tales: Chapter-Wide Manga Transcriptions with Character Names
par: Sachdeva, Ragav, et autres
Publié: (2024)
par: Sachdeva, Ragav, et autres
Publié: (2024)
HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled Generation
par: Wang, Boyuan, et autres
Publié: (2025)
par: Wang, Boyuan, et autres
Publié: (2025)
Motion Control for Enhanced Complex Action Video Generation
par: Zhou, Qiang, et autres
Publié: (2024)
par: Zhou, Qiang, et autres
Publié: (2024)
Direct Motion Models for Assessing Generated Videos
par: Allen, Kelsey, et autres
Publié: (2025)
par: Allen, Kelsey, et autres
Publié: (2025)
HumanScore: Benchmarking Human Motions in Generated Videos
par: Fang, Yusu, et autres
Publié: (2026)
par: Fang, Yusu, et autres
Publié: (2026)
Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs
par: Tasnim, Nazia, et autres
Publié: (2025)
par: Tasnim, Nazia, et autres
Publié: (2025)
Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs Supplementary
par: Tasnim, Nazia, et autres
Publié: (2026)
par: Tasnim, Nazia, et autres
Publié: (2026)
CoT-PL: Chain-of-Thought Pseudo-Labeling for Open-Vocabulary Object Detection
par: Choi, Hojun, et autres
Publié: (2025)
par: Choi, Hojun, et autres
Publié: (2025)
Label-Augmented Dataset Distillation
par: Kang, Seoungyoon, et autres
Publié: (2024)
par: Kang, Seoungyoon, et autres
Publié: (2024)
MotionCharacter: Fine-Grained Motion Controllable Human Video Generation
par: Fang, Haopeng, et autres
Publié: (2024)
par: Fang, Haopeng, et autres
Publié: (2024)
Swift Sampling: Selecting Temporal Surprises via Taylor Series
par: Kim, Dahye, et autres
Publié: (2026)
par: Kim, Dahye, et autres
Publié: (2026)
Human Motion Video Generation: A Survey
par: Xue, Haiwei, et autres
Publié: (2025)
par: Xue, Haiwei, et autres
Publié: (2025)
Generating Continual Human Motion in Diverse 3D Scenes
par: Mir, Aymen, et autres
Publié: (2023)
par: Mir, Aymen, et autres
Publié: (2023)
Generating Human Motion Videos using a Cascaded Text-to-Video Framework
par: Nam, Hyelin, et autres
Publié: (2025)
par: Nam, Hyelin, et autres
Publié: (2025)
Toward Rich Video Human-Motion2D Generation
par: Xi, Ruihao, et autres
Publié: (2025)
par: Xi, Ruihao, et autres
Publié: (2025)
MotionLLM: Understanding Human Behaviors from Human Motions and Videos
par: Chen, Ling-Hao, et autres
Publié: (2024)
par: Chen, Ling-Hao, et autres
Publié: (2024)
SINC: Spatial Composition of 3D Human Motions for Simultaneous Action Generation
par: Athanasiou, Nikos, et autres
Publié: (2023)
par: Athanasiou, Nikos, et autres
Publié: (2023)
EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer
par: Yang, Yuxiao, et autres
Publié: (2025)
par: Yang, Yuxiao, et autres
Publié: (2025)
Towards Geometry-Aware and Motion-Guided Video Human Mesh Recovery
par: Chen, Hongjun, et autres
Publié: (2026)
par: Chen, Hongjun, et autres
Publié: (2026)
MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation
par: Shi, Shuwei, et autres
Publié: (2024)
par: Shi, Shuwei, et autres
Publié: (2024)
GeoDE: a Geographically Diverse Evaluation Dataset for Object Recognition
par: Ramaswamy, Vikram V., et autres
Publié: (2023)
par: Ramaswamy, Vikram V., et autres
Publié: (2023)
Progressive Human Motion Generation Based on Text and Few Motion Frames
par: Zeng, Ling-An, et autres
Publié: (2025)
par: Zeng, Ling-An, et autres
Publié: (2025)
HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation
par: Gan, Qijun, et autres
Publié: (2025)
par: Gan, Qijun, et autres
Publié: (2025)
Telling Stories for Common Sense Zero-Shot Action Recognition
par: Gowda, Shreyank N, et autres
Publié: (2023)
par: Gowda, Shreyank N, et autres
Publié: (2023)
SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation
par: Tan, Shuai, et autres
Publié: (2025)
par: Tan, Shuai, et autres
Publié: (2025)
Tell-Tale Watermarks for Explanatory Reasoning in Synthetic Media Forensics
par: Chang, Ching-Chun, et autres
Publié: (2025)
par: Chang, Ching-Chun, et autres
Publié: (2025)
Documents similaires
-
What's in a Latent? Leveraging Diffusion Latent Space for Domain Generalization
par: Thomas, Xavier, et autres
Publié: (2025) -
FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models
par: Lim, Youngsun, et autres
Publié: (2026) -
$\textit{Revelio}$: Interpreting and leveraging semantic information in diffusion models
par: Kim, Dahye, et autres
Publié: (2024) -
Concept Steerers: Leveraging K-Sparse Autoencoders for Test-Time Controllable Generations
par: Kim, Dahye, et autres
Publié: (2025) -
Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance
par: Qiu, Jason, et autres
Publié: (2026)