Scene Summarization: Clustering Scene Videos into Spatially Diverse Frames
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Chao, Zhu, Mingzhi, Singh, Ankush Pratap, Yan, Yu, Juefei-Xu, Felix, Feng, Chen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Populate-A-Scene: Affordance-Aware Human Video Generation
por: Shan, Mengyi, et al.
Publicado: (2025)
por: Shan, Mengyi, et al.
Publicado: (2025)
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
por: Chen, Seng Nam, et al.
Publicado: (2026)
por: Chen, Seng Nam, et al.
Publicado: (2026)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
por: Yang, Xuyi, et al.
Publicado: (2025)
por: Yang, Xuyi, et al.
Publicado: (2025)
Frame-Level Captions for Long Video Generation with Complex Multi Scenes
por: Zheng, Guangcong, et al.
Publicado: (2025)
por: Zheng, Guangcong, et al.
Publicado: (2025)
Sparse4DGS: 4D Gaussian Splatting for Sparse-Frame Dynamic Scene Reconstruction
por: Shi, Changyue, et al.
Publicado: (2025)
por: Shi, Changyue, et al.
Publicado: (2025)
Multiview Scene Graph
por: Zhang, Juexiao, et al.
Publicado: (2024)
por: Zhang, Juexiao, et al.
Publicado: (2024)
Syllables to Scenes: Literary-Guided Free-Viewpoint 3D Scene Synthesis from Japanese Haiku
por: Yu, Chunan, et al.
Publicado: (2025)
por: Yu, Chunan, et al.
Publicado: (2025)
Scene123: One Prompt to 3D Scene Generation via Video-Assisted and Consistency-Enhanced MAE
por: Yang, Yiying, et al.
Publicado: (2024)
por: Yang, Yiying, et al.
Publicado: (2024)
CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation
por: Huang, Kaiyi, et al.
Publicado: (2026)
por: Huang, Kaiyi, et al.
Publicado: (2026)
Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion
por: Liu, Enyu, et al.
Publicado: (2025)
por: Liu, Enyu, et al.
Publicado: (2025)
SpatialCrafter: Unleashing the Imagination of Video Diffusion Models for Scene Reconstruction from Limited Observations
por: Zhang, Songchun, et al.
Publicado: (2025)
por: Zhang, Songchun, et al.
Publicado: (2025)
Injecting Frame-Event Complementary Fusion into Diffusion for Optical Flow in Challenging Scenes
por: Wang, Haonan, et al.
Publicado: (2025)
por: Wang, Haonan, et al.
Publicado: (2025)
SceneCraft: Layout-Guided 3D Scene Generation
por: Yang, Xiuyu, et al.
Publicado: (2024)
por: Yang, Xiuyu, et al.
Publicado: (2024)
ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment
por: Dong, Mingyu, et al.
Publicado: (2026)
por: Dong, Mingyu, et al.
Publicado: (2026)
V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes
por: Zhang, Yanming, et al.
Publicado: (2025)
por: Zhang, Yanming, et al.
Publicado: (2025)
SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency
por: Song, Quanjian, et al.
Publicado: (2025)
por: Song, Quanjian, et al.
Publicado: (2025)
SAMJAM: Zero-Shot Video Scene Graph Generation for Egocentric Kitchen Videos
por: Li, Joshua, et al.
Publicado: (2025)
por: Li, Joshua, et al.
Publicado: (2025)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
por: Feng, Zhiyuan, et al.
Publicado: (2025)
por: Feng, Zhiyuan, et al.
Publicado: (2025)
Gated Fields: Learning Scene Reconstruction from Gated Videos
por: Ramazzina, Andrea, et al.
Publicado: (2024)
por: Ramazzina, Andrea, et al.
Publicado: (2024)
Boosting Semi-Supervised Scene Text Recognition via Viewing and Summarizing
por: Qu, Yadong, et al.
Publicado: (2024)
por: Qu, Yadong, et al.
Publicado: (2024)
Static Scene Reconstruction from Dynamic Egocentric Videos
por: Cui, Qifei, et al.
Publicado: (2026)
por: Cui, Qifei, et al.
Publicado: (2026)
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
por: Xu, Pengxin, et al.
Publicado: (2026)
por: Xu, Pengxin, et al.
Publicado: (2026)
$α$-OCC: Uncertainty-Aware Camera-based 3D Semantic Occupancy Prediction
por: Su, Sanbao, et al.
Publicado: (2024)
por: Su, Sanbao, et al.
Publicado: (2024)
Gap Completion in Point Cloud Scene occluded by Vehicles using SGC-Net
por: Feng, Yu, et al.
Publicado: (2024)
por: Feng, Yu, et al.
Publicado: (2024)
VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
por: Wang, Hanyang, et al.
Publicado: (2025)
por: Wang, Hanyang, et al.
Publicado: (2025)
MSVCOD:A Large-Scale Multi-Scene Dataset for Video Camouflage Object Detection
por: Gao, Shuyong, et al.
Publicado: (2025)
por: Gao, Shuyong, et al.
Publicado: (2025)
Bridge Frame and Event: Common Spatiotemporal Fusion for High-Dynamic Scene Optical Flow
por: Zhou, Hanyu, et al.
Publicado: (2025)
por: Zhou, Hanyu, et al.
Publicado: (2025)
DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation
por: Chen, Mu, et al.
Publicado: (2025)
por: Chen, Mu, et al.
Publicado: (2025)
Spatial As Deep: Spatial CNN for Traffic Scene Understanding
por: Pan, Xingang, et al.
Publicado: (2017)
por: Pan, Xingang, et al.
Publicado: (2017)
Prior-Enhanced Gaussian Splatting for Dynamic Scene Reconstruction from Casual Video
por: Shih, Meng-Li, et al.
Publicado: (2025)
por: Shih, Meng-Li, et al.
Publicado: (2025)
AudioScenic: Audio-Driven Video Scene Editing
por: Shen, Kaixin, et al.
Publicado: (2024)
por: Shen, Kaixin, et al.
Publicado: (2024)
3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation
por: Lee, JoungBin, et al.
Publicado: (2025)
por: Lee, JoungBin, et al.
Publicado: (2025)
Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models
por: Berman, Nimrod, et al.
Publicado: (2025)
por: Berman, Nimrod, et al.
Publicado: (2025)
SceneGlue: Scene-Aware Transformer for Feature Matching without Scene-Level Annotation
por: Du, Songlin, et al.
Publicado: (2026)
por: Du, Songlin, et al.
Publicado: (2026)
AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond
por: Zhang, Haiming, et al.
Publicado: (2026)
por: Zhang, Haiming, et al.
Publicado: (2026)
LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning
por: Chao, Lianying, et al.
Publicado: (2026)
por: Chao, Lianying, et al.
Publicado: (2026)
Feed-Forward SceneDINO for Unsupervised Semantic Scene Completion
por: Jevtić, Aleksandar, et al.
Publicado: (2025)
por: Jevtić, Aleksandar, et al.
Publicado: (2025)
Fast Low-light Enhancement and Deblurring for 3D Dark Scenes
por: Zhang, Feng, et al.
Publicado: (2026)
por: Zhang, Feng, et al.
Publicado: (2026)
SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding
por: Zeng, Nianbo, et al.
Publicado: (2025)
por: Zeng, Nianbo, et al.
Publicado: (2025)
Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing
por: Li, Yanjun, et al.
Publicado: (2025)
por: Li, Yanjun, et al.
Publicado: (2025)
Ejemplares similares
-
Populate-A-Scene: Affordance-Aware Human Video Generation
por: Shan, Mengyi, et al.
Publicado: (2025) -
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
por: Chen, Seng Nam, et al.
Publicado: (2026) -
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
por: Yang, Xuyi, et al.
Publicado: (2025) -
Frame-Level Captions for Long Video Generation with Complex Multi Scenes
por: Zheng, Guangcong, et al.
Publicado: (2025) -
Sparse4DGS: 4D Gaussian Splatting for Sparse-Frame Dynamic Scene Reconstruction
por: Shi, Changyue, et al.
Publicado: (2025)