PreFM: Online Audio-Visual Event Parsing via Predictive Future Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Xiao, Fang, Yan, Jin, Xiaojie, Zhao, Yao, Wei, Yunchao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
IPSeg: Image Posterior Mitigates Semantic Drift in Class-Incremental Segmentation
par: Yu, Xiao, et autres
Publié: (2025)
par: Yu, Xiao, et autres
Publié: (2025)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
PixelLM: Pixel Reasoning with Large Multimodal Model
par: Ren, Zhongwei, et autres
Publié: (2023)
par: Ren, Zhongwei, et autres
Publié: (2023)
VideoWorld 2: Learning Transferable Knowledge from Real-world Videos
par: Ren, Zhongwei, et autres
Publié: (2026)
par: Ren, Zhongwei, et autres
Publié: (2026)
Let ViT Speak: Generative Language-Image Pre-training
par: Fang, Yan, et autres
Publié: (2026)
par: Fang, Yan, et autres
Publié: (2026)
Reinforced Label Denoising for Weakly-Supervised Audio-Visual Video Parsing
par: Gao, Yongbiao, et autres
Publié: (2024)
par: Gao, Yongbiao, et autres
Publié: (2024)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
par: Wang, Langyu, et autres
Publié: (2025)
par: Wang, Langyu, et autres
Publié: (2025)
VideoWorld: Exploring Knowledge Learning from Unlabeled Videos
par: Ren, Zhongwei, et autres
Publié: (2025)
par: Ren, Zhongwei, et autres
Publié: (2025)
DreamLCM: Towards High-Quality Text-to-3D Generation via Latent Consistency Model
par: Zhong, Yiming, et autres
Publié: (2024)
par: Zhong, Yiming, et autres
Publié: (2024)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
par: Zhao, Pengcheng, et autres
Publié: (2024)
par: Zhao, Pengcheng, et autres
Publié: (2024)
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
par: Wang, Langyu, et autres
Publié: (2024)
par: Wang, Langyu, et autres
Publié: (2024)
FlexVAR: Flexible Visual Autoregressive Modeling without Residual Prediction
par: Jiao, Siyu, et autres
Publié: (2025)
par: Jiao, Siyu, et autres
Publié: (2025)
ACTRESS: Active Retraining for Semi-supervised Visual Grounding
par: Kang, Weitai, et autres
Publié: (2024)
par: Kang, Weitai, et autres
Publié: (2024)
Frozen CLIP: A Strong Backbone for Weakly Supervised Semantic Segmentation
par: Zhang, Bingfeng, et autres
Publié: (2024)
par: Zhang, Bingfeng, et autres
Publié: (2024)
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
par: Yu, Li, et autres
Publié: (2025)
par: Yu, Li, et autres
Publié: (2025)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
par: Zhao, Shifang, et autres
Publié: (2025)
par: Zhao, Shifang, et autres
Publié: (2025)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
A Unified Reasoning Framework for Holistic Zero-Shot Video Anomaly Analysis
par: Lin, Dongheng, et autres
Publié: (2025)
par: Lin, Dongheng, et autres
Publié: (2025)
PanoWorld-X: Generating Explorable Panoramic Worlds via Sphere-Aware Video Diffusion
par: Yin, Yuyang, et autres
Publié: (2025)
par: Yin, Yuyang, et autres
Publié: (2025)
Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
par: Tan, Chuangchuang, et autres
Publié: (2025)
par: Tan, Chuangchuang, et autres
Publié: (2025)
Efficient Document Parsing via Parallel Token Prediction
par: Li, Lei, et autres
Publié: (2026)
par: Li, Lei, et autres
Publié: (2026)
UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing
par: Lai, Yung-Hsuan, et autres
Publié: (2025)
par: Lai, Yung-Hsuan, et autres
Publié: (2025)
3DResT: A Strong Baseline for Semi-Supervised 3D Referring Expression Segmentation
par: Chen, Wenxin, et autres
Publié: (2025)
par: Chen, Wenxin, et autres
Publié: (2025)
Collaborative Feature-Logits Contrastive Learning for Open-Set Semi-Supervised Object Detection
par: Zhong, Xinhao, et autres
Publié: (2024)
par: Zhong, Xinhao, et autres
Publié: (2024)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
par: Chen, Yaru, et autres
Publié: (2025)
par: Chen, Yaru, et autres
Publié: (2025)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
par: Li, Huilai, et autres
Publié: (2026)
par: Li, Huilai, et autres
Publié: (2026)
StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
par: Xing, Ke, et autres
Publié: (2025)
par: Xing, Ke, et autres
Publié: (2025)
Learning Trimaps via Clicks for Image Matting
par: Zhang, Chenyi, et autres
Publié: (2024)
par: Zhang, Chenyi, et autres
Publié: (2024)
ThinkGen: Generalized Thinking for Visual Generation
par: Jiao, Siyu, et autres
Publié: (2025)
par: Jiao, Siyu, et autres
Publié: (2025)
UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing
par: Zhang, Jiaxi, et autres
Publié: (2026)
par: Zhang, Jiaxi, et autres
Publié: (2026)
LapFM: A Laparoscopic Segmentation Foundation Model via Hierarchical Concept Evolving Pre-training
par: Xu, Qing, et autres
Publié: (2025)
par: Xu, Qing, et autres
Publié: (2025)
Attend and Enrich: Enhanced Visual Prompt for Zero-Shot Learning
par: Liu, Man, et autres
Publié: (2024)
par: Liu, Man, et autres
Publié: (2024)
ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models
par: Tan, Chuangchuang, et autres
Publié: (2025)
par: Tan, Chuangchuang, et autres
Publié: (2025)
Prediction of Alzheimer's Disease Risk Factors from Retinal Images via Deep Learning: Development and Validation of Biologically Relevant Morphological Associations in the UK Biobank
par: Leem, Seowung, et autres
Publié: (2026)
par: Leem, Seowung, et autres
Publié: (2026)
Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization
par: Xing, Ling, et autres
Publié: (2024)
par: Xing, Ling, et autres
Publié: (2024)
MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
par: Wang, Wenjie, et autres
Publié: (2026)
par: Wang, Wenjie, et autres
Publié: (2026)
CoLeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio-Visual Video Parsing
par: Sardari, Faegheh, et autres
Publié: (2024)
par: Sardari, Faegheh, et autres
Publié: (2024)
FairMedFM: Fairness Benchmarking for Medical Imaging Foundation Models
par: Jin, Ruinan, et autres
Publié: (2024)
par: Jin, Ruinan, et autres
Publié: (2024)
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
par: Xu, Pengxin, et autres
Publié: (2026)
par: Xu, Pengxin, et autres
Publié: (2026)
Single-stage Multi-human Parsing via Point Sets and Center-based Offsets
par: Chu, Jiaming, et autres
Publié: (2023)
par: Chu, Jiaming, et autres
Publié: (2023)
Documents similaires
-
IPSeg: Image Posterior Mitigates Semantic Drift in Class-Incremental Segmentation
par: Yu, Xiao, et autres
Publié: (2025) -
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
par: Zhou, Jinxing, et autres
Publié: (2024) -
PixelLM: Pixel Reasoning with Large Multimodal Model
par: Ren, Zhongwei, et autres
Publié: (2023) -
VideoWorld 2: Learning Transferable Knowledge from Real-world Videos
par: Ren, Zhongwei, et autres
Publié: (2026) -
Let ViT Speak: Generative Language-Image Pre-training
par: Fang, Yan, et autres
Publié: (2026)