Efficient Neural Video Representation with Temporally Coherent Modulation
Fuente:
arXiv
Saved in:
| Main Authors: | Shin, Seungjun, Kim, Suji, Oh, Dokwan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Diversify, Contextualize, and Adapt: Efficient Entropy Modeling for Neural Image Codec
by: Kim, Jun-Hyuk, et al.
Published: (2024)
by: Kim, Jun-Hyuk, et al.
Published: (2024)
OrthoRank: Token Selection via Sink Token Orthogonality for Efficient LLM inference
by: Shin, Seungjun, et al.
Published: (2025)
by: Shin, Seungjun, et al.
Published: (2025)
House of Cards: Massive Weights in LLMs
by: Oh, Jaehoon, et al.
Published: (2024)
by: Oh, Jaehoon, et al.
Published: (2024)
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
by: Kim, Kangsan, et al.
Published: (2026)
by: Kim, Kangsan, et al.
Published: (2026)
FLAIR: Frequency- and Locality-Aware Implicit Neural Representations
by: Ko, Sukhun, et al.
Published: (2025)
by: Ko, Sukhun, et al.
Published: (2025)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
by: Yue, Feng, et al.
Published: (2025)
by: Yue, Feng, et al.
Published: (2025)
Temporal Aware Pruning for Efficient Diffusion-based Video Generation
by: Li, Sheng, et al.
Published: (2026)
by: Li, Sheng, et al.
Published: (2026)
TTF: Temporal Token Fusion for Efficient Video-Language Model
by: Huo, Simin, et al.
Published: (2026)
by: Huo, Simin, et al.
Published: (2026)
WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving
by: Yu, Seungjun, et al.
Published: (2025)
by: Yu, Seungjun, et al.
Published: (2025)
FMA-Net++: Motion- and Exposure-Aware Real-World Joint Video Super-Resolution and Deblurring
by: Youk, Geunhyuk, et al.
Published: (2025)
by: Youk, Geunhyuk, et al.
Published: (2025)
Don't Judge by the Look: Towards Motion Coherent Video Representation
by: Zhang, Yitian, et al.
Published: (2024)
by: Zhang, Yitian, et al.
Published: (2024)
Real-Time Long Horizon Air Quality Forecasting via Group-Relative Policy Optimization
by: Kang, Inha, et al.
Published: (2025)
by: Kang, Inha, et al.
Published: (2025)
Progressive Fourier Neural Representation for Sequential Video Compilation
by: Kang, Haeyong, et al.
Published: (2023)
by: Kang, Haeyong, et al.
Published: (2023)
Deformable Dynamic Convolution for Accurate yet Efficient Spatio-Temporal Traffic Prediction
by: Jin, Hyeonseok, et al.
Published: (2025)
by: Jin, Hyeonseok, et al.
Published: (2025)
FPANet: Frequency-based Video Demoireing using Frame-level Post Alignment
by: Oh, Gyeongrok, et al.
Published: (2023)
by: Oh, Gyeongrok, et al.
Published: (2023)
DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos
by: Lu, Zijia, et al.
Published: (2025)
by: Lu, Zijia, et al.
Published: (2025)
What and When to Look?: Temporal Span Proposal Network for Video Relation Detection
by: Woo, Sangmin, et al.
Published: (2021)
by: Woo, Sangmin, et al.
Published: (2021)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
by: Kang, Minseok, et al.
Published: (2026)
by: Kang, Minseok, et al.
Published: (2026)
On the Temporality for Sketch Representation Learning
by: Junior, Marcelo Isaias de Moraes, et al.
Published: (2025)
by: Junior, Marcelo Isaias de Moraes, et al.
Published: (2025)
What Happens When: Learning Temporal Orders of Events in Videos
by: Ahn, Daechul, et al.
Published: (2025)
by: Ahn, Daechul, et al.
Published: (2025)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
by: Oh, Ju-Young, et al.
Published: (2025)
by: Oh, Ju-Young, et al.
Published: (2025)
VideoMaMa: Mask-Guided Video Matting via Generative Prior
by: Lim, Sangbeom, et al.
Published: (2026)
by: Lim, Sangbeom, et al.
Published: (2026)
Segment Any 3D Object with Language
by: Lee, Seungjun, et al.
Published: (2024)
by: Lee, Seungjun, et al.
Published: (2024)
EgoExo-Con: Exploring View-Invariant Video Temporal Understanding
by: Jung, Minjoon, et al.
Published: (2025)
by: Jung, Minjoon, et al.
Published: (2025)
DiET-GS: Diffusion Prior and Event Stream-Assisted Motion Deblurring 3D Gaussian Splatting
by: Lee, Seungjun, et al.
Published: (2025)
by: Lee, Seungjun, et al.
Published: (2025)
Temporal vs. Spatial: Comparing DINOv3 and V-JEPA2 Feature Representations for Video Action Analysis
by: Kodathala, Sai Varun, et al.
Published: (2025)
by: Kodathala, Sai Varun, et al.
Published: (2025)
BF-STVSR: B-Splines and Fourier-Best Friends for High Fidelity Spatial-Temporal Video Super-Resolution
by: Kim, Eunjin, et al.
Published: (2025)
by: Kim, Eunjin, et al.
Published: (2025)
DETACH : Decomposed Spatio-Temporal Alignment for Exocentric Video and Ambient Sensors with Staged Learning
by: Yoon, Junho, et al.
Published: (2025)
by: Yoon, Junho, et al.
Published: (2025)
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
by: Luo, Bingjun, et al.
Published: (2026)
by: Luo, Bingjun, et al.
Published: (2026)
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
by: Hyun, Jeongseok, et al.
Published: (2025)
by: Hyun, Jeongseok, et al.
Published: (2025)
VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis
by: Park, Jinho, et al.
Published: (2026)
by: Park, Jinho, et al.
Published: (2026)
Tuning-Free Multi-Event Long Video Generation via Synchronized Coupled Sampling
by: Kim, Subin, et al.
Published: (2025)
by: Kim, Subin, et al.
Published: (2025)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
by: Wang, Shihao, et al.
Published: (2025)
by: Wang, Shihao, et al.
Published: (2025)
VideoSAGE: Video Summarization with Graph Representation Learning
by: Chaves, Jose M. Rojas, et al.
Published: (2024)
by: Chaves, Jose M. Rojas, et al.
Published: (2024)
CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation
by: Zeng, Qinglin, et al.
Published: (2025)
by: Zeng, Qinglin, et al.
Published: (2025)
LRConv-NeRV: Low Rank Convolution for Efficient Neural Video Compression
by: Shanableh, Tamer
Published: (2026)
by: Shanableh, Tamer
Published: (2026)
AURA: Development and Validation of an Augmented Unplanned Removal Alert System using Synthetic ICU Videos
by: Seo, Junhyuk, et al.
Published: (2025)
by: Seo, Junhyuk, et al.
Published: (2025)
Efficient Event-Based Object Detection: A Hybrid Neural Network with Spatial and Temporal Attention
by: Ahmed, Soikat Hasan, et al.
Published: (2024)
by: Ahmed, Soikat Hasan, et al.
Published: (2024)
FPRF: Feed-Forward Photorealistic Style Transfer of Large-Scale 3D Neural Radiance Fields
by: Kim, GeonU, et al.
Published: (2024)
by: Kim, GeonU, et al.
Published: (2024)
Landmark-guided Diffusion Model for High-fidelity and Temporally Coherent Talking Head Generation
by: Tan, Jintao, et al.
Published: (2024)
by: Tan, Jintao, et al.
Published: (2024)
Similar Items
-
Diversify, Contextualize, and Adapt: Efficient Entropy Modeling for Neural Image Codec
by: Kim, Jun-Hyuk, et al.
Published: (2024) -
OrthoRank: Token Selection via Sink Token Orthogonality for Efficient LLM inference
by: Shin, Seungjun, et al.
Published: (2025) -
House of Cards: Massive Weights in LLMs
by: Oh, Jaehoon, et al.
Published: (2024) -
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
by: Kim, Kangsan, et al.
Published: (2026) -
FLAIR: Frequency- and Locality-Aware Implicit Neural Representations
by: Ko, Sukhun, et al.
Published: (2025)