Salvato in:
| Autori principali: | Wang, Zixuan, Sun, Yu, Wang, Hongwei, Jing, Baoyu, Shen, Xiang, Dong, Xin, Hao, Zhuolin, Xiong, Hongyu, Song, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2509.21486 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When Rules Fall Short: Agent-Driven Discovery of Emerging Content Issues in Short Video Platforms
di: Yu, Chenghui, et al.
Pubblicazione: (2026)
di: Yu, Chenghui, et al.
Pubblicazione: (2026)
IPS: In-Prompt Process Supervision for Short Video Content Moderation
di: Liu, Mingchao, et al.
Pubblicazione: (2024)
di: Liu, Mingchao, et al.
Pubblicazione: (2024)
Filter-And-Refine: A MLLM Based Cascade System for Industrial-Scale Video Content Moderation
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion
di: Sun, Yu, et al.
Pubblicazione: (2025)
di: Sun, Yu, et al.
Pubblicazione: (2025)
A Step Toward Federated Pretraining of Multimodal Large Language Models
di: Xiong, Baochen, et al.
Pubblicazione: (2026)
di: Xiong, Baochen, et al.
Pubblicazione: (2026)
CPFD: Confidence-aware Privileged Feature Distillation for Short Video Classification
di: Shi, Jinghao, et al.
Pubblicazione: (2024)
di: Shi, Jinghao, et al.
Pubblicazione: (2024)
Embedding-based Retrieval in Multimodal Content Moderation
di: Liang, Hanzhong, et al.
Pubblicazione: (2025)
di: Liang, Hanzhong, et al.
Pubblicazione: (2025)
Research on Short-Video Platform User Decision-Making via Multimodal Temporal Modeling and Reinforcement Learning
di: Wang, Jinmeiyang, et al.
Pubblicazione: (2025)
di: Wang, Jinmeiyang, et al.
Pubblicazione: (2025)
COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework
di: Dong, Xin, et al.
Pubblicazione: (2024)
di: Dong, Xin, et al.
Pubblicazione: (2024)
A Nonparallel Support Tensor Machine for Binary Classification based Large Margin Distribution and Iterative Optimization
di: Du, Zhuolin, et al.
Pubblicazione: (2025)
di: Du, Zhuolin, et al.
Pubblicazione: (2025)
Failures to Surface Harmful Contents in Video Large Language Models
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
di: Cao, Yuxin, et al.
Pubblicazione: (2025)
M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
C3LLM: Conditional Multimodal Content Generation Using Large Language Models
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
MindCine: Multimodal EEG-to-Video Reconstruction with Large-Scale Pretrained Models
di: Zhou, Tian-Yi, et al.
Pubblicazione: (2026)
di: Zhou, Tian-Yi, et al.
Pubblicazione: (2026)
Adaptive Sliding Mode Control for Uncertain Tilting Quadrotors Using Randomized Feedforward Neural Networks
di: Jing‐Jing Xiong, et al.
Pubblicazione: (2026)
di: Jing‐Jing Xiong, et al.
Pubblicazione: (2026)
Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
di: Xiong, Weimin, et al.
Pubblicazione: (2026)
di: Xiong, Weimin, et al.
Pubblicazione: (2026)
Knowledge Vector of Logical Reasoning in Large Language Models
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
Multimodal Contrastive Pretraining of CBCT and IOS for Enhanced Tooth Segmentation
di: Son, Moo Hyun, et al.
Pubblicazione: (2025)
di: Son, Moo Hyun, et al.
Pubblicazione: (2025)
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
di: Tang, Yolo Y., et al.
Pubblicazione: (2025)
Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey
di: Zhu, Jason, et al.
Pubblicazione: (2025)
di: Zhu, Jason, et al.
Pubblicazione: (2025)
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
di: Wan, Zhongwei, et al.
Pubblicazione: (2025)
di: Wan, Zhongwei, et al.
Pubblicazione: (2025)
Pretraining with Token-Level Adaptive Latent Chain-of-Thought
di: Zeng, Boyi, et al.
Pubblicazione: (2026)
di: Zeng, Boyi, et al.
Pubblicazione: (2026)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
Hydra-Nav: Object Navigation via Adaptive Dual-Process Reasoning
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
An Efficient Memory Gradient Method for Extreme M-Eigenvalues of Elastic type Tensors
di: Du, Zhuolin, et al.
Pubblicazione: (2026)
di: Du, Zhuolin, et al.
Pubblicazione: (2026)
Enhancing Reasoning to Adapt Large Language Models for Domain-Specific Applications
di: Wen, Bo, et al.
Pubblicazione: (2025)
di: Wen, Bo, et al.
Pubblicazione: (2025)
Engagement Prediction of Short Videos with Large Multimodal Models
di: Sun, Wei, et al.
Pubblicazione: (2025)
di: Sun, Wei, et al.
Pubblicazione: (2025)
Unveiling the Reasoning Process of Large Language Models
di: Zhang, Junjie, et al.
Pubblicazione: (2026)
di: Zhang, Junjie, et al.
Pubblicazione: (2026)
PBSE Data Initialization Framework and Practice by Using LLM
di: Degang Liang, et al.
Pubblicazione: (2025)
di: Degang Liang, et al.
Pubblicazione: (2025)
PBSE Data Initialization Framework and Practice by Using LLM
di: Degang Liang, et al.
Pubblicazione: (2025)
di: Degang Liang, et al.
Pubblicazione: (2025)
DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning
di: Wan, Zhongwei, et al.
Pubblicazione: (2026)
di: Wan, Zhongwei, et al.
Pubblicazione: (2026)
VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge
di: Song, Yueqi, et al.
Pubblicazione: (2025)
di: Song, Yueqi, et al.
Pubblicazione: (2025)
LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation
di: Li, Sha, et al.
Pubblicazione: (2025)
di: Li, Sha, et al.
Pubblicazione: (2025)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
di: Wang, Zhepeng, et al.
Pubblicazione: (2025)
di: Wang, Zhepeng, et al.
Pubblicazione: (2025)
Enhancing Conversational Recommender Systems with Tree-Structured Knowledge and Pretrained Language Models
di: Ren, Yongwen, et al.
Pubblicazione: (2025)
di: Ren, Yongwen, et al.
Pubblicazione: (2025)
TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
CADC: Content Adaptive Diffusion-Based Generative Image Compression
di: Sheng, Xihua, et al.
Pubblicazione: (2026)
di: Sheng, Xihua, et al.
Pubblicazione: (2026)
Large‐Scale Fabrication of Stable Silicon Anode in Air for Sulfide Solid State Batteries via Ionic‐Electronic Dual Conductive Binder
di: Zhilu Wang, et al.
Pubblicazione: (2024)
di: Zhilu Wang, et al.
Pubblicazione: (2024)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
When Rules Fall Short: Agent-Driven Discovery of Emerging Content Issues in Short Video Platforms
di: Yu, Chenghui, et al.
Pubblicazione: (2026) -
IPS: In-Prompt Process Supervision for Short Video Content Moderation
di: Liu, Mingchao, et al.
Pubblicazione: (2024) -
Filter-And-Refine: A MLLM Based Cascade System for Industrial-Scale Video Content Moderation
di: Wang, Zixuan, et al.
Pubblicazione: (2025) -
Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion
di: Sun, Yu, et al.
Pubblicazione: (2025) -
A Step Toward Federated Pretraining of Multimodal Large Language Models
di: Xiong, Baochen, et al.
Pubblicazione: (2026)