Structured Context Learning for Generic Event Boundary Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gu, Xin, Li, Congcong, Wang, Xinyao, Hong, Dexiang, Zhang, Libo, Luo, Tiejian, Wen, Longyin, Fan, Heng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Context-Guided Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2024)
par: Gu, Xin, et autres
Publié: (2024)
Edit3K: Universal Representation Learning for Video Editing Components
par: Gu, Xin, et autres
Publié: (2024)
par: Gu, Xin, et autres
Publié: (2024)
Multi-Reward as Condition for Instruction-based Image Editing
par: Gu, Xin, et autres
Publié: (2024)
par: Gu, Xin, et autres
Publié: (2024)
Robust Domain Adaptive Object Detection with Unified Multi-Granularity Alignment
par: Zhang, Libo, et autres
Publié: (2023)
par: Zhang, Libo, et autres
Publié: (2023)
Accurate and Fast Compressed Video Captioning
par: Shen, Yaojie, et autres
Publié: (2023)
par: Shen, Yaojie, et autres
Publié: (2023)
Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2025)
par: Gu, Xin, et autres
Publié: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
par: Gu, Xin, et autres
Publié: (2025)
par: Gu, Xin, et autres
Publié: (2025)
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
par: Li, Bingxuan, et autres
Publié: (2025)
par: Li, Bingxuan, et autres
Publié: (2025)
Fine-grained Dynamic Network for Generic Event Boundary Detection
par: Zheng, Ziwei, et autres
Publié: (2024)
par: Zheng, Ziwei, et autres
Publié: (2024)
Flow-Guided Diffusion for Video Inpainting
par: Gu, Bohai, et autres
Publié: (2023)
par: Gu, Bohai, et autres
Publié: (2023)
CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts
par: Li, Jiachen, et autres
Publié: (2024)
par: Li, Jiachen, et autres
Publié: (2024)
Robust Ego-Exo Correspondence with Long-Term Memory
par: Hu, Yijun, et autres
Publié: (2025)
par: Hu, Yijun, et autres
Publié: (2025)
Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model
par: Xu, Lu, et autres
Publié: (2024)
par: Xu, Lu, et autres
Publié: (2024)
CGTrack: Cascade Gating Network with Hierarchical Feature Aggregation for UAV Tracking
par: Li, Weihong, et autres
Publié: (2025)
par: Li, Weihong, et autres
Publié: (2025)
Towards Long-Form Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2026)
par: Gu, Xin, et autres
Publié: (2026)
Rethinking the Architecture Design for Efficient Generic Event Boundary Detection
par: Zheng, Ziwei, et autres
Publié: (2024)
par: Zheng, Ziwei, et autres
Publié: (2024)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
par: Kuo, Chia-Wen, et autres
Publié: (2025)
par: Kuo, Chia-Wen, et autres
Publié: (2025)
BPDO:Boundary Points Dynamic Optimization for Arbitrary Shape Scene Text Detection
par: Zheng, Jinzhi, et autres
Publié: (2024)
par: Zheng, Jinzhi, et autres
Publié: (2024)
Generalization-Enhanced Few-Shot Object Detection in Remote Sensing
par: Lin, Hui, et autres
Publié: (2025)
par: Lin, Hui, et autres
Publié: (2025)
SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
High-Fidelity Image Inpainting with Multimodal Guided GAN Inversion
par: Zhang, Libo, et autres
Publié: (2025)
par: Zhang, Libo, et autres
Publié: (2025)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
par: Yao, Jiali, et autres
Publié: (2025)
par: Yao, Jiali, et autres
Publié: (2025)
Online Generic Event Boundary Detection
par: Jung, Hyungrok, et autres
Publié: (2025)
par: Jung, Hyungrok, et autres
Publié: (2025)
LaMOT: Language-Guided Multi-Object Tracking
par: Li, Yunhao, et autres
Publié: (2024)
par: Li, Yunhao, et autres
Publié: (2024)
G3CN: Gaussian Topology Refinement Gated Graph Convolutional Network for Skeleton-Based Action Recognition
par: Ren, Haiqing, et autres
Publié: (2025)
par: Ren, Haiqing, et autres
Publié: (2025)
CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers
par: Chen, Weidong, et autres
Publié: (2026)
par: Chen, Weidong, et autres
Publié: (2026)
GSOT3D: Towards Generic 3D Single Object Tracking in the Wild
par: Jiao, Yifan, et autres
Publié: (2024)
par: Jiao, Yifan, et autres
Publié: (2024)
Generic Event Boundary Detection via Denoising Diffusion
par: Hwang, Jaejun, et autres
Publié: (2025)
par: Hwang, Jaejun, et autres
Publié: (2025)
DreamPoster: A Unified Framework for Image-Conditioned Generative Poster Design
par: Hu, Xiwei, et autres
Publié: (2025)
par: Hu, Xiwei, et autres
Publié: (2025)
CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation
par: Zhang, Hui, et autres
Publié: (2024)
par: Zhang, Hui, et autres
Publié: (2024)
What's in the Flow? Exploiting Temporal Motion Cues for Unsupervised Generic Event Boundary Detection
par: Gothe, Sourabh Vasant, et autres
Publié: (2024)
par: Gothe, Sourabh Vasant, et autres
Publié: (2024)
VisRefiner: Learning from Visual Differences for Screenshot-to-Code Generation
par: Deng, Jie, et autres
Publié: (2026)
par: Deng, Jie, et autres
Publié: (2026)
Real-time Stereo-based 3D Object Detection for Streaming Perception
par: Li, Changcai, et autres
Publié: (2024)
par: Li, Changcai, et autres
Publié: (2024)
A Dual-Branch Framework for Semantic Change Detection with Boundary and Temporal Awareness
par: Li, Yun-Cheng, et autres
Publié: (2026)
par: Li, Yun-Cheng, et autres
Publié: (2026)
Attention to Trajectory: Trajectory-Aware Open-Vocabulary Tracking
par: Li, Yunhao, et autres
Publié: (2025)
par: Li, Yunhao, et autres
Publié: (2025)
CreatiPoster: Towards Editable and Controllable Multi-Layer Graphic Design Generation
par: Zhang, Zhao, et autres
Publié: (2025)
par: Zhang, Zhao, et autres
Publié: (2025)
Leveraging Satellite Image Time Series for Accurate Extreme Event Detection
par: Fang, Heng, et autres
Publié: (2025)
par: Fang, Heng, et autres
Publié: (2025)
PlanarTrack: A high-quality and challenging benchmark for large-scale planar object tracking
par: Jiao, Yifan, et autres
Publié: (2025)
par: Jiao, Yifan, et autres
Publié: (2025)
FedRSClip: Federated Learning for Remote Sensing Scene Classification Using Vision-Language Models
par: Lin, Hui, et autres
Publié: (2025)
par: Lin, Hui, et autres
Publié: (2025)
Learning Dynamic Structural Specialization for Underwater Salient Object Detection
par: Hong, Lin, et autres
Publié: (2026)
par: Hong, Lin, et autres
Publié: (2026)
Documents similaires
-
Context-Guided Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2024) -
Edit3K: Universal Representation Learning for Video Editing Components
par: Gu, Xin, et autres
Publié: (2024) -
Multi-Reward as Condition for Instruction-based Image Editing
par: Gu, Xin, et autres
Publié: (2024) -
Robust Domain Adaptive Object Detection with Unified Multi-Granularity Alignment
par: Zhang, Libo, et autres
Publié: (2023) -
Accurate and Fast Compressed Video Captioning
par: Shen, Yaojie, et autres
Publié: (2023)