Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zixuan, Sun, Yu, Wang, Hongwei, Jing, Baoyu, Shen, Xiang, Dong, Xin, Hao, Zhuolin, Xiong, Hongyu, Song, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When Rules Fall Short: Agent-Driven Discovery of Emerging Content Issues in Short Video Platforms
di: Yu, Chenghui, et al.
Pubblicazione: (2026)
di: Yu, Chenghui, et al.
Pubblicazione: (2026)
IPS: In-Prompt Process Supervision for Short Video Content Moderation
di: Liu, Mingchao, et al.
Pubblicazione: (2024)
di: Liu, Mingchao, et al.
Pubblicazione: (2024)
Filter-And-Refine: A MLLM Based Cascade System for Industrial-Scale Video Content Moderation
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion
di: Sun, Yu, et al.
Pubblicazione: (2025)
di: Sun, Yu, et al.
Pubblicazione: (2025)
A Step Toward Federated Pretraining of Multimodal Large Language Models
di: Xiong, Baochen, et al.
Pubblicazione: (2026)
di: Xiong, Baochen, et al.
Pubblicazione: (2026)
CPFD: Confidence-aware Privileged Feature Distillation for Short Video Classification
di: Shi, Jinghao, et al.
Pubblicazione: (2024)
di: Shi, Jinghao, et al.
Pubblicazione: (2024)
Research on Short-Video Platform User Decision-Making via Multimodal Temporal Modeling and Reinforcement Learning
di: Wang, Jinmeiyang, et al.
Pubblicazione: (2025)
di: Wang, Jinmeiyang, et al.
Pubblicazione: (2025)
Embedding-based Retrieval in Multimodal Content Moderation
di: Liang, Hanzhong, et al.
Pubblicazione: (2025)
di: Liang, Hanzhong, et al.
Pubblicazione: (2025)
Failures to Surface Harmful Contents in Video Large Language Models
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework
di: Dong, Xin, et al.
Pubblicazione: (2024)
di: Dong, Xin, et al.
Pubblicazione: (2024)
A Nonparallel Support Tensor Machine for Binary Classification based Large Margin Distribution and Iterative Optimization
di: Du, Zhuolin, et al.
Pubblicazione: (2025)
di: Du, Zhuolin, et al.
Pubblicazione: (2025)
MindCine: Multimodal EEG-to-Video Reconstruction with Large-Scale Pretrained Models
di: Zhou, Tian-Yi, et al.
Pubblicazione: (2026)
di: Zhou, Tian-Yi, et al.
Pubblicazione: (2026)
C3LLM: Conditional Multimodal Content Generation Using Large Language Models
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
di: Xiong, Weimin, et al.
Pubblicazione: (2026)
di: Xiong, Weimin, et al.
Pubblicazione: (2026)
Adaptive Sliding Mode Control for Uncertain Tilting Quadrotors Using Randomized Feedforward Neural Networks
di: Jing‐Jing Xiong, et al.
Pubblicazione: (2026)
di: Jing‐Jing Xiong, et al.
Pubblicazione: (2026)
Multimodal Contrastive Pretraining of CBCT and IOS for Enhanced Tooth Segmentation
di: Son, Moo Hyun, et al.
Pubblicazione: (2025)
di: Son, Moo Hyun, et al.
Pubblicazione: (2025)
Knowledge Vector of Logical Reasoning in Large Language Models
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey
di: Zhu, Jason, et al.
Pubblicazione: (2025)
di: Zhu, Jason, et al.
Pubblicazione: (2025)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
Enhancing Reasoning to Adapt Large Language Models for Domain-Specific Applications
di: Wen, Bo, et al.
Pubblicazione: (2025)
di: Wen, Bo, et al.
Pubblicazione: (2025)
Engagement Prediction of Short Videos with Large Multimodal Models
di: Sun, Wei, et al.
Pubblicazione: (2025)
di: Sun, Wei, et al.
Pubblicazione: (2025)
Pretraining with Token-Level Adaptive Latent Chain-of-Thought
di: Zeng, Boyi, et al.
Pubblicazione: (2026)
di: Zeng, Boyi, et al.
Pubblicazione: (2026)
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
di: Wan, Zhongwei, et al.
Pubblicazione: (2025)
di: Wan, Zhongwei, et al.
Pubblicazione: (2025)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
di: Wang, Zhepeng, et al.
Pubblicazione: (2025)
di: Wang, Zhepeng, et al.
Pubblicazione: (2025)
TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge
di: Song, Yueqi, et al.
Pubblicazione: (2025)
di: Song, Yueqi, et al.
Pubblicazione: (2025)
LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation
di: Li, Sha, et al.
Pubblicazione: (2025)
di: Li, Sha, et al.
Pubblicazione: (2025)
Hydra-Nav: Object Navigation via Adaptive Dual-Process Reasoning
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
Unveiling the Reasoning Process of Large Language Models
di: Zhang, Junjie, et al.
Pubblicazione: (2026)
di: Zhang, Junjie, et al.
Pubblicazione: (2026)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
Enhancing Conversational Recommender Systems with Tree-Structured Knowledge and Pretrained Language Models
di: Ren, Yongwen, et al.
Pubblicazione: (2025)
di: Ren, Yongwen, et al.
Pubblicazione: (2025)
How to Auto-optimize Prompts for Domain Tasks? Adaptive Prompting and Reasoning through Evolutionary Domain Knowledge Adaptation
di: Zhao, Yang, et al.
Pubblicazione: (2025)
di: Zhao, Yang, et al.
Pubblicazione: (2025)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
CADC: Content Adaptive Diffusion-Based Generative Image Compression
di: Sheng, Xihua, et al.
Pubblicazione: (2026)
di: Sheng, Xihua, et al.
Pubblicazione: (2026)
Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video Misinformation
di: Huang, Jen-tse, et al.
Pubblicazione: (2026)
di: Huang, Jen-tse, et al.
Pubblicazione: (2026)
Reasoning-Driven Multimodal LLM for Domain Generalization
di: Xu, Zhipeng, et al.
Pubblicazione: (2026)
di: Xu, Zhipeng, et al.
Pubblicazione: (2026)
VideoPro: Adaptive Program Reasoning for Long Video Understanding
di: Li, Chenglin, et al.
Pubblicazione: (2025)
di: Li, Chenglin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
When Rules Fall Short: Agent-Driven Discovery of Emerging Content Issues in Short Video Platforms
di: Yu, Chenghui, et al.
Pubblicazione: (2026) -
IPS: In-Prompt Process Supervision for Short Video Content Moderation
di: Liu, Mingchao, et al.
Pubblicazione: (2024) -
Filter-And-Refine: A MLLM Based Cascade System for Industrial-Scale Video Content Moderation
di: Wang, Zixuan, et al.
Pubblicazione: (2025) -
Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion
di: Sun, Yu, et al.
Pubblicazione: (2025) -
A Step Toward Federated Pretraining of Multimodal Large Language Models
di: Xiong, Baochen, et al.
Pubblicazione: (2026)