VideoAds for Fast-Paced Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zheyuan, Dou, Monica, Peng, Linkai, Pan, Hongyi, Bagci, Ulas, Gong, Boqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TAGS: 3D Tumor-Adaptive Guidance for SAM
di: Li, Sirui, et al.
Pubblicazione: (2025)
di: Li, Sirui, et al.
Pubblicazione: (2025)
Segmentation Quality and Volumetric Accuracy in Medical Imaging
di: Zhang, Zheyuan, et al.
Pubblicazione: (2024)
di: Zhang, Zheyuan, et al.
Pubblicazione: (2024)
AdsQA: Towards Advertisement Video Understanding
di: Long, Xinwei, et al.
Pubblicazione: (2025)
di: Long, Xinwei, et al.
Pubblicazione: (2025)
Optimizing Synthetic Data for Enhanced Pancreatic Tumor Segmentation
di: Peng, Linkai, et al.
Pubblicazione: (2024)
di: Peng, Linkai, et al.
Pubblicazione: (2024)
Rethink Domain Generalization in Heterogeneous Sequence MRI Segmentation
di: Zhang, Zheyuan, et al.
Pubblicazione: (2025)
di: Zhang, Zheyuan, et al.
Pubblicazione: (2025)
CrossPan: A Comprehensive Benchmark for Cross-Sequence Pancreas MRI Segmentation and Generalization
di: Peng, Linkai, et al.
Pubblicazione: (2026)
di: Peng, Linkai, et al.
Pubblicazione: (2026)
Federated Breast Cancer Detection Enhanced by Synthetic Ultrasound Image Augmentation
di: Pan, Hongyi, et al.
Pubblicazione: (2025)
di: Pan, Hongyi, et al.
Pubblicazione: (2025)
Deformable Capsules for Object Detection
di: Lalonde, Rodney, et al.
Pubblicazione: (2021)
di: Lalonde, Rodney, et al.
Pubblicazione: (2021)
WFM: 3D Wavelet Flow Matching for Ultrafast Multi-Modal MRI Synthesis
di: Tur, Yalcin, et al.
Pubblicazione: (2026)
di: Tur, Yalcin, et al.
Pubblicazione: (2026)
Discrete Cosine Transform Based Decorrelated Attention for Vision Transformers
di: Pan, Hongyi, et al.
Pubblicazione: (2024)
di: Pan, Hongyi, et al.
Pubblicazione: (2024)
Explainable Transformer Prototypes for Medical Diagnoses
di: Demir, Ugur, et al.
Pubblicazione: (2024)
di: Demir, Ugur, et al.
Pubblicazione: (2024)
VideoGLUE: Video General Understanding Evaluation of Foundation Models
di: Yuan, Liangzhe, et al.
Pubblicazione: (2023)
di: Yuan, Liangzhe, et al.
Pubblicazione: (2023)
Moiré Video Authentication: A Physical Signature Against AI Video Generation
di: Qing, Yuan, et al.
Pubblicazione: (2026)
di: Qing, Yuan, et al.
Pubblicazione: (2026)
DiffBoost: Enhancing Medical Image Segmentation via Text-Guided Diffusion Model
di: Zhang, Zheyuan, et al.
Pubblicazione: (2023)
di: Zhang, Zheyuan, et al.
Pubblicazione: (2023)
Classification of Endoscopy and Video Capsule Images using CNN-Transformer Model
di: Subedi, Aliza, et al.
Pubblicazione: (2024)
di: Subedi, Aliza, et al.
Pubblicazione: (2024)
PAM-UNet: Shifting Attention on Region of Interest in Medical Images
di: Das, Abhijit, et al.
Pubblicazione: (2024)
di: Das, Abhijit, et al.
Pubblicazione: (2024)
Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2025)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2025)
Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long Videos
di: Pan, Yulin, et al.
Pubblicazione: (2023)
di: Pan, Yulin, et al.
Pubblicazione: (2023)
Omni-Video: Democratizing Unified Video Understanding and Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
Improved Segmentation of Polyps and Visual Explainability Analysis
di: Asare, Akwasi, et al.
Pubblicazione: (2025)
di: Asare, Akwasi, et al.
Pubblicazione: (2025)
NextAds: Towards Next-generation Personalized Video Advertising
di: Xu, Yiyan, et al.
Pubblicazione: (2026)
di: Xu, Yiyan, et al.
Pubblicazione: (2026)
VideoPrism: A Foundational Visual Encoder for Video Understanding
di: Zhao, Long, et al.
Pubblicazione: (2024)
di: Zhao, Long, et al.
Pubblicazione: (2024)
Pediatric Pancreas Segmentation from MRI Scans with Deep Learning
di: Keles, Elif, et al.
Pubblicazione: (2025)
di: Keles, Elif, et al.
Pubblicazione: (2025)
Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding
di: Xiong, Yuanhao, et al.
Pubblicazione: (2023)
di: Xiong, Yuanhao, et al.
Pubblicazione: (2023)
LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs
di: Kim, Jihwan, et al.
Pubblicazione: (2026)
di: Kim, Jihwan, et al.
Pubblicazione: (2026)
ViCTr: Vital Consistency Transfer for Pathology Aware Image Synthesis
di: Susladkar, Onkar, et al.
Pubblicazione: (2025)
di: Susladkar, Onkar, et al.
Pubblicazione: (2025)
CTest-Metric: A Unified Framework to Assess Clinical Validity of Metrics for CT Report Generation
di: Sharma, Vanshali, et al.
Pubblicazione: (2026)
di: Sharma, Vanshali, et al.
Pubblicazione: (2026)
VideoLucy: Deep Memory Backtracking for Long Video Understanding
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
Lifting Data-Tracing Machine Unlearning to Knowledge-Tracing for Foundation Models
di: Tan, Yuwen, et al.
Pubblicazione: (2025)
di: Tan, Yuwen, et al.
Pubblicazione: (2025)
Culture in Action: Evaluating Text-to-Image Models through Social Activities
di: Malakouti, Sina, et al.
Pubblicazione: (2025)
di: Malakouti, Sina, et al.
Pubblicazione: (2025)
FastVID: Dynamic Density Pruning for Fast Video Large Language Models
di: Shen, Leqi, et al.
Pubblicazione: (2025)
di: Shen, Leqi, et al.
Pubblicazione: (2025)
SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control
di: Zhang, Zhida, et al.
Pubblicazione: (2026)
di: Zhang, Zhida, et al.
Pubblicazione: (2026)
VideoExpert: Augmented LLM for Temporal-Sensitive Video Understanding
di: Zhao, Henghao, et al.
Pubblicazione: (2025)
di: Zhao, Henghao, et al.
Pubblicazione: (2025)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
MammoClean: Toward Reproducible and Bias-Aware AI in Mammography through Dataset Harmonization
di: Zafari, Yalda, et al.
Pubblicazione: (2025)
di: Zafari, Yalda, et al.
Pubblicazione: (2025)
Neptune: The Long Orbit to Benchmarking Long Video Understanding
di: Nagrani, Arsha, et al.
Pubblicazione: (2024)
di: Nagrani, Arsha, et al.
Pubblicazione: (2024)
Align then Refine: Text-Guided 3D Prostate Lesion Segmentation
di: Sun, Cuiling, et al.
Pubblicazione: (2026)
di: Sun, Cuiling, et al.
Pubblicazione: (2026)
PP-SAM: Perturbed Prompts for Robust Adaptation of Segment Anything Model for Polyp Segmentation
di: Rahman, Md Mostafijur, et al.
Pubblicazione: (2024)
di: Rahman, Md Mostafijur, et al.
Pubblicazione: (2024)
Distilling Vision-Language Models on Millions of Videos
di: Zhao, Yue, et al.
Pubblicazione: (2024)
di: Zhao, Yue, et al.
Pubblicazione: (2024)
Extending Video Masked Autoencoders to 128 frames
di: Gundavarapu, Nitesh Bharadwaj, et al.
Pubblicazione: (2024)
di: Gundavarapu, Nitesh Bharadwaj, et al.
Pubblicazione: (2024)
Documenti analoghi
-
TAGS: 3D Tumor-Adaptive Guidance for SAM
di: Li, Sirui, et al.
Pubblicazione: (2025) -
Segmentation Quality and Volumetric Accuracy in Medical Imaging
di: Zhang, Zheyuan, et al.
Pubblicazione: (2024) -
AdsQA: Towards Advertisement Video Understanding
di: Long, Xinwei, et al.
Pubblicazione: (2025) -
Optimizing Synthetic Data for Enhanced Pancreatic Tumor Segmentation
di: Peng, Linkai, et al.
Pubblicazione: (2024) -
Rethink Domain Generalization in Heterogeneous Sequence MRI Segmentation
di: Zhang, Zheyuan, et al.
Pubblicazione: (2025)