Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zixuan, Sun, Yu, Wang, Hongwei, Jing, Baoyu, Shen, Xiang, Dong, Xin, Hao, Zhuolin, Xiong, Hongyu, Song, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Rules Fall Short: Agent-Driven Discovery of Emerging Content Issues in Short Video Platforms
par: Yu, Chenghui, et autres
Publié: (2026)
par: Yu, Chenghui, et autres
Publié: (2026)
IPS: In-Prompt Process Supervision for Short Video Content Moderation
par: Liu, Mingchao, et autres
Publié: (2024)
par: Liu, Mingchao, et autres
Publié: (2024)
Filter-And-Refine: A MLLM Based Cascade System for Industrial-Scale Video Content Moderation
par: Wang, Zixuan, et autres
Publié: (2025)
par: Wang, Zixuan, et autres
Publié: (2025)
Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion
par: Sun, Yu, et autres
Publié: (2025)
par: Sun, Yu, et autres
Publié: (2025)
A Step Toward Federated Pretraining of Multimodal Large Language Models
par: Xiong, Baochen, et autres
Publié: (2026)
par: Xiong, Baochen, et autres
Publié: (2026)
CPFD: Confidence-aware Privileged Feature Distillation for Short Video Classification
par: Shi, Jinghao, et autres
Publié: (2024)
par: Shi, Jinghao, et autres
Publié: (2024)
Research on Short-Video Platform User Decision-Making via Multimodal Temporal Modeling and Reinforcement Learning
par: Wang, Jinmeiyang, et autres
Publié: (2025)
par: Wang, Jinmeiyang, et autres
Publié: (2025)
Embedding-based Retrieval in Multimodal Content Moderation
par: Liang, Hanzhong, et autres
Publié: (2025)
par: Liang, Hanzhong, et autres
Publié: (2025)
Failures to Surface Harmful Contents in Video Large Language Models
par: Cao, Yuxin, et autres
Publié: (2025)
par: Cao, Yuxin, et autres
Publié: (2025)
COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework
par: Dong, Xin, et autres
Publié: (2024)
par: Dong, Xin, et autres
Publié: (2024)
A Nonparallel Support Tensor Machine for Binary Classification based Large Margin Distribution and Iterative Optimization
par: Du, Zhuolin, et autres
Publié: (2025)
par: Du, Zhuolin, et autres
Publié: (2025)
MindCine: Multimodal EEG-to-Video Reconstruction with Large-Scale Pretrained Models
par: Zhou, Tian-Yi, et autres
Publié: (2026)
par: Zhou, Tian-Yi, et autres
Publié: (2026)
C3LLM: Conditional Multimodal Content Generation Using Large Language Models
par: Wang, Zixuan, et autres
Publié: (2024)
par: Wang, Zixuan, et autres
Publié: (2024)
M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models
par: Wang, Hongyu, et autres
Publié: (2024)
par: Wang, Hongyu, et autres
Publié: (2024)
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
par: Xiong, Weimin, et autres
Publié: (2026)
par: Xiong, Weimin, et autres
Publié: (2026)
Adaptive Sliding Mode Control for Uncertain Tilting Quadrotors Using Randomized Feedforward Neural Networks
par: Jing‐Jing Xiong, et autres
Publié: (2026)
par: Jing‐Jing Xiong, et autres
Publié: (2026)
Multimodal Contrastive Pretraining of CBCT and IOS for Enhanced Tooth Segmentation
par: Son, Moo Hyun, et autres
Publié: (2025)
par: Son, Moo Hyun, et autres
Publié: (2025)
Knowledge Vector of Logical Reasoning in Large Language Models
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
par: Tang, Yolo Y., et autres
Publié: (2025)
par: Tang, Yolo Y., et autres
Publié: (2025)
Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey
par: Zhu, Jason, et autres
Publié: (2025)
par: Zhu, Jason, et autres
Publié: (2025)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
par: Cheng, Daixuan, et autres
Publié: (2024)
par: Cheng, Daixuan, et autres
Publié: (2024)
Enhancing Reasoning to Adapt Large Language Models for Domain-Specific Applications
par: Wen, Bo, et autres
Publié: (2025)
par: Wen, Bo, et autres
Publié: (2025)
Engagement Prediction of Short Videos with Large Multimodal Models
par: Sun, Wei, et autres
Publié: (2025)
par: Sun, Wei, et autres
Publié: (2025)
Pretraining with Token-Level Adaptive Latent Chain-of-Thought
par: Zeng, Boyi, et autres
Publié: (2026)
par: Zeng, Boyi, et autres
Publié: (2026)
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
par: Wan, Zhongwei, et autres
Publié: (2025)
par: Wan, Zhongwei, et autres
Publié: (2025)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
par: Wang, Zhepeng, et autres
Publié: (2025)
par: Wang, Zhepeng, et autres
Publié: (2025)
TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval
par: Hao, Xiangzhao, et autres
Publié: (2026)
par: Hao, Xiangzhao, et autres
Publié: (2026)
VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge
par: Song, Yueqi, et autres
Publié: (2025)
par: Song, Yueqi, et autres
Publié: (2025)
LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation
par: Li, Sha, et autres
Publié: (2025)
par: Li, Sha, et autres
Publié: (2025)
Hydra-Nav: Object Navigation via Adaptive Dual-Process Reasoning
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
Unveiling the Reasoning Process of Large Language Models
par: Zhang, Junjie, et autres
Publié: (2026)
par: Zhang, Junjie, et autres
Publié: (2026)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
par: Deng, Andong, et autres
Publié: (2025)
par: Deng, Andong, et autres
Publié: (2025)
Enhancing Conversational Recommender Systems with Tree-Structured Knowledge and Pretrained Language Models
par: Ren, Yongwen, et autres
Publié: (2025)
par: Ren, Yongwen, et autres
Publié: (2025)
How to Auto-optimize Prompts for Domain Tasks? Adaptive Prompting and Reasoning through Evolutionary Domain Knowledge Adaptation
par: Zhao, Yang, et autres
Publié: (2025)
par: Zhao, Yang, et autres
Publié: (2025)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
par: Zhou, Zikun, et autres
Publié: (2024)
par: Zhou, Zikun, et autres
Publié: (2024)
CADC: Content Adaptive Diffusion-Based Generative Image Compression
par: Sheng, Xihua, et autres
Publié: (2026)
par: Sheng, Xihua, et autres
Publié: (2026)
Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video Misinformation
par: Huang, Jen-tse, et autres
Publié: (2026)
par: Huang, Jen-tse, et autres
Publié: (2026)
Reasoning-Driven Multimodal LLM for Domain Generalization
par: Xu, Zhipeng, et autres
Publié: (2026)
par: Xu, Zhipeng, et autres
Publié: (2026)
VideoPro: Adaptive Program Reasoning for Long Video Understanding
par: Li, Chenglin, et autres
Publié: (2025)
par: Li, Chenglin, et autres
Publié: (2025)
Documents similaires
-
When Rules Fall Short: Agent-Driven Discovery of Emerging Content Issues in Short Video Platforms
par: Yu, Chenghui, et autres
Publié: (2026) -
IPS: In-Prompt Process Supervision for Short Video Content Moderation
par: Liu, Mingchao, et autres
Publié: (2024) -
Filter-And-Refine: A MLLM Based Cascade System for Industrial-Scale Video Content Moderation
par: Wang, Zixuan, et autres
Publié: (2025) -
Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion
par: Sun, Yu, et autres
Publié: (2025) -
A Step Toward Federated Pretraining of Multimodal Large Language Models
par: Xiong, Baochen, et autres
Publié: (2026)