Tempered Self-Similarity Alignment for Physically Plausible Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Manjin, Kwak, Suha, Cho, Minsu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploring High-Order Self-Similarity for Video Understanding
par: Kim, Manjin, et autres
Publié: (2026)
par: Kim, Manjin, et autres
Publié: (2026)
Part-Aware Bottom-Up Group Reasoning for Fine-Grained Social Interaction Detection
par: Kim, Dongkeun, et autres
Publié: (2025)
par: Kim, Dongkeun, et autres
Publié: (2025)
Online Temporal Action Localization with Memory-Augmented Transformer
par: Song, Youngkil, et autres
Publié: (2024)
par: Song, Youngkil, et autres
Publié: (2024)
Towards More Practical Group Activity Detection: A New Benchmark and Model
par: Kim, Dongkeun, et autres
Publié: (2023)
par: Kim, Dongkeun, et autres
Publié: (2023)
ActFusion: a Unified Diffusion Model for Action Segmentation and Anticipation
par: Gong, Dayoung, et autres
Publié: (2024)
par: Gong, Dayoung, et autres
Publié: (2024)
Generic Event Boundary Detection via Denoising Diffusion
par: Hwang, Jaejun, et autres
Publié: (2025)
par: Hwang, Jaejun, et autres
Publié: (2025)
Learning Correlation Structures for Vision Transformers
par: Kim, Manjin, et autres
Publié: (2024)
par: Kim, Manjin, et autres
Publié: (2024)
Classification Matters: Improving Video Action Detection with Class-Specific Attention
par: Lee, Jinsung, et autres
Publié: (2024)
par: Lee, Jinsung, et autres
Publié: (2024)
Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model
par: Kim, Dongwon, et autres
Publié: (2026)
par: Kim, Dongwon, et autres
Publié: (2026)
Similarity-Aware Selective State-Space Modeling for Semantic Correspondence
par: Kim, Seungwook, et autres
Publié: (2025)
par: Kim, Seungwook, et autres
Publié: (2025)
Learning Audio-guided Video Representation with Gated Attention for Video-Text Retrieval
par: Jeong, Boseung, et autres
Publié: (2025)
par: Jeong, Boseung, et autres
Publié: (2025)
Bootstrapping Top-down Information for Self-modulating Slot Attention
par: Kim, Dongwon, et autres
Publié: (2024)
par: Kim, Dongwon, et autres
Publié: (2024)
Extending CLIP's Image-Text Alignment to Referring Image Segmentation
par: Kim, Seoyeon, et autres
Publié: (2023)
par: Kim, Seoyeon, et autres
Publié: (2023)
Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards
par: Kim, Seungwook, et autres
Publié: (2026)
par: Kim, Seungwook, et autres
Publié: (2026)
FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation
par: Kim, Seungwook, et autres
Publié: (2025)
par: Kim, Seungwook, et autres
Publié: (2025)
FREST: Feature RESToration for Semantic Segmentation under Multiple Adverse Conditions
par: Lee, Sohyun, et autres
Publié: (2024)
par: Lee, Sohyun, et autres
Publié: (2024)
Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation
par: Hassan, Mariam, et autres
Publié: (2026)
par: Hassan, Mariam, et autres
Publié: (2026)
Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
par: Hao, Yutong, et autres
Publié: (2025)
par: Hao, Yutong, et autres
Publié: (2025)
Video Self-Distillation for Single-Image Encoders: A Step Toward Physically Plausible Perception
par: Simon, Marcel, et autres
Publié: (2025)
par: Simon, Marcel, et autres
Publié: (2025)
Active Label Correction for Semantic Segmentation with Foundation Models
par: Kim, Hoyoung, et autres
Publié: (2024)
par: Kim, Hoyoung, et autres
Publié: (2024)
PLOT: Text-based Person Search with Part Slot Attention for Corresponding Part Discovery
par: Park, Jicheol, et autres
Publié: (2024)
par: Park, Jicheol, et autres
Publié: (2024)
Harnessing the Power of Training-Free Techniques in Text-to-2D Generation for Text-to-3D Generation via Score Distillation Sampling
par: Lee, Junhong, et autres
Publié: (2025)
par: Lee, Junhong, et autres
Publié: (2025)
Hierarchically Structured Neural Bones for Reconstructing Animatable Objects from Casual Videos
par: Jeon, Subin, et autres
Publié: (2024)
par: Jeon, Subin, et autres
Publié: (2024)
RePL: Pseudo-label Refinement for Semi-supervised LiDAR Semantic Segmentation
par: Kwon, Donghyeon, et autres
Publié: (2026)
par: Kwon, Donghyeon, et autres
Publié: (2026)
Extreme Point Supervised Instance Segmentation
par: Lee, Hyeonjun, et autres
Publié: (2024)
par: Lee, Hyeonjun, et autres
Publié: (2024)
Learning Unified Distance Metric Across Diverse Data Distributions with Parameter-Efficient Transfer Learning
par: Kim, Sungyeon, et autres
Publié: (2023)
par: Kim, Sungyeon, et autres
Publié: (2023)
Structured State-Space Regularization for Generation-Friendly Image Tokenization
par: Lee, Jinsung, et autres
Publié: (2026)
par: Lee, Jinsung, et autres
Publié: (2026)
GroupCoOp: Group-robust Fine-tuning via Group Prompt Learning
par: Kim, Nayeong, et autres
Publié: (2025)
par: Kim, Nayeong, et autres
Publié: (2025)
Robust Promptable Video Object Segmentation
par: Lee, Sohyun, et autres
Publié: (2026)
par: Lee, Sohyun, et autres
Publié: (2026)
Efficient and Versatile Robust Fine-Tuning of Zero-shot Models
par: Kim, Sungyeon, et autres
Publié: (2024)
par: Kim, Sungyeon, et autres
Publié: (2024)
Chain of Event-Centric Causal Thought for Physically Plausible Video Generation
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
par: Chen, Harold Haodong, et autres
Publié: (2025)
par: Chen, Harold Haodong, et autres
Publié: (2025)
MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling
par: Lin, Shubo, et autres
Publié: (2026)
par: Lin, Shubo, et autres
Publié: (2026)
Video Summarization with Large Language Models
par: Lee, Min Jung, et autres
Publié: (2025)
par: Lee, Min Jung, et autres
Publié: (2025)
From Generated Human Videos to Physically Plausible Robot Trajectories
par: Ni, James, et autres
Publié: (2025)
par: Ni, James, et autres
Publié: (2025)
OrthoPhys: Physically Plausible Video Generation with Orthogonal-View Geometry Guidance
par: Wang, Cong, et autres
Publié: (2026)
par: Wang, Cong, et autres
Publié: (2026)
Improving Text-based Person Search via Part-level Cross-modal Correspondence
par: Park, Jicheol, et autres
Publié: (2024)
par: Park, Jicheol, et autres
Publié: (2024)
GaRA-SAM: Robustifying Segment Anything Model with Gated-Rank Adaptation
par: Lee, Sohyun, et autres
Publié: (2025)
par: Lee, Sohyun, et autres
Publié: (2025)
Locality-Aware Zero-Shot Human-Object Interaction Detection
par: Kim, Sanghyun, et autres
Publié: (2025)
par: Kim, Sanghyun, et autres
Publié: (2025)
TestDG: Test-time Domain Generalization for Continual Test-time Adaptation
par: Lee, Sohyun, et autres
Publié: (2025)
par: Lee, Sohyun, et autres
Publié: (2025)
Documents similaires
-
Exploring High-Order Self-Similarity for Video Understanding
par: Kim, Manjin, et autres
Publié: (2026) -
Part-Aware Bottom-Up Group Reasoning for Fine-Grained Social Interaction Detection
par: Kim, Dongkeun, et autres
Publié: (2025) -
Online Temporal Action Localization with Memory-Augmented Transformer
par: Song, Youngkil, et autres
Publié: (2024) -
Towards More Practical Group Activity Detection: A New Benchmark and Model
par: Kim, Dongkeun, et autres
Publié: (2023) -
ActFusion: a Unified Diffusion Model for Action Segmentation and Anticipation
par: Gong, Dayoung, et autres
Publié: (2024)