BLM-Guard: Explainable Multimodal Ad Moderation with Chain-of-Thought and Policy-Aligned Rewards
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Yiran, Liu, Zhaowei, Yuan, Yuan, Song, Yukun, Ma, Xiong, Song, Yinghao, Zeng, Xiangji, Sun, Lu, Wang, Yulu, Zhou, Hai, Cui, Shuai, Gong, Zhaohan, Zhang, Jiefei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization
di: Ding, Ruiyi, et al.
Pubblicazione: (2026)
di: Ding, Ruiyi, et al.
Pubblicazione: (2026)
ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
Upfront Chain-of-Thought: A Cooperative Framework for Chain-of-Thought Compression
di: Li, Chengzhengxu, et al.
Pubblicazione: (2025)
di: Li, Chengzhengxu, et al.
Pubblicazione: (2025)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
di: Xiong, Zhen, et al.
Pubblicazione: (2025)
di: Xiong, Zhen, et al.
Pubblicazione: (2025)
Tool-MCoT: Tool Augmented Multimodal Chain-of-Thought for Content Safety Moderation
di: Zhang, Shutong, et al.
Pubblicazione: (2026)
di: Zhang, Shutong, et al.
Pubblicazione: (2026)
Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
di: Xiong, Xuan, et al.
Pubblicazione: (2026)
di: Xiong, Xuan, et al.
Pubblicazione: (2026)
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025)
di: Wu, Qiong, et al.
Pubblicazione: (2025)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
di: Li, Yunheng, et al.
Pubblicazione: (2026)
di: Li, Yunheng, et al.
Pubblicazione: (2026)
Towards Trustworthy Multimodal Moderation via Policy-Aligned Reasoning and Hierarchical Labeling
di: Li, Anqi, et al.
Pubblicazione: (2025)
di: Li, Anqi, et al.
Pubblicazione: (2025)
To Reason or Not to: Selective Chain-of-Thought in Medical Question Answering
di: Zhan, Zaifu, et al.
Pubblicazione: (2026)
di: Zhan, Zaifu, et al.
Pubblicazione: (2026)
Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization
di: Zaman, Kerem, et al.
Pubblicazione: (2025)
di: Zaman, Kerem, et al.
Pubblicazione: (2025)
From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought
di: Tan, Wentao, et al.
Pubblicazione: (2025)
di: Tan, Wentao, et al.
Pubblicazione: (2025)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
di: Jiang, Jingjing, et al.
Pubblicazione: (2025)
di: Jiang, Jingjing, et al.
Pubblicazione: (2025)
X-Guard: Multilingual Guard Agent for Content Moderation
di: Upadhayay, Bibek, et al.
Pubblicazione: (2025)
di: Upadhayay, Bibek, et al.
Pubblicazione: (2025)
Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
di: Yu, Sheldon, et al.
Pubblicazione: (2025)
di: Yu, Sheldon, et al.
Pubblicazione: (2025)
RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution
di: Song, Yushuai, et al.
Pubblicazione: (2026)
di: Song, Yushuai, et al.
Pubblicazione: (2026)
Demystifying Multilingual Chain-of-Thought in Process Reward Modeling
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
SA-IQA: Redefining Image Quality Assessment for Spatial Aesthetics with Multi-Dimensional Rewards
di: Gao, Yuan, et al.
Pubblicazione: (2025)
di: Gao, Yuan, et al.
Pubblicazione: (2025)
CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction
di: Ma, Yinghao, et al.
Pubblicazione: (2026)
di: Ma, Yinghao, et al.
Pubblicazione: (2026)
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
di: Yang, Yankai, et al.
Pubblicazione: (2026)
di: Yang, Yankai, et al.
Pubblicazione: (2026)
ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails
di: Wang, Yan, et al.
Pubblicazione: (2026)
di: Wang, Yan, et al.
Pubblicazione: (2026)
Beyond Chain-of-Thought, Effective Graph-of-Thought Reasoning in Language Models
di: Yao, Yao, et al.
Pubblicazione: (2023)
di: Yao, Yao, et al.
Pubblicazione: (2023)
Rethinking Chain-of-Thought Reasoning for Videos
di: Zhong, Yiwu, et al.
Pubblicazione: (2025)
di: Zhong, Yiwu, et al.
Pubblicazione: (2025)
EMPA: Evaluating Persona-Aligned Empathy as a Process
di: Zhang, Shiya, et al.
Pubblicazione: (2026)
di: Zhang, Shiya, et al.
Pubblicazione: (2026)
GeoChain: Multimodal Chain-of-Thought for Geographic Reasoning
di: Yerramilli, Sahiti, et al.
Pubblicazione: (2025)
di: Yerramilli, Sahiti, et al.
Pubblicazione: (2025)
Reward Collapse in Aligning Large Language Models
di: Song, Ziang, et al.
Pubblicazione: (2023)
di: Song, Ziang, et al.
Pubblicazione: (2023)
Imminent Geologic and Hydrologic Hazards on Fort Ord BLM Land
di: Smith, Douglas
Pubblicazione: (2008)
di: Smith, Douglas
Pubblicazione: (2008)
PAM: Training Policy-Aligned Moderation Filters at Scale
di: Fatehkia, Masoomali, et al.
Pubblicazione: (2025)
di: Fatehkia, Masoomali, et al.
Pubblicazione: (2025)
BingoGuard: LLM Content Moderation Tools with Risk Levels
di: Yin, Fan, et al.
Pubblicazione: (2025)
di: Yin, Fan, et al.
Pubblicazione: (2025)
Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning
di: Turpin, Miles, et al.
Pubblicazione: (2025)
di: Turpin, Miles, et al.
Pubblicazione: (2025)
Missing Value Chain in Generative AI Governance China as an example
di: Pi, Yulu
Pubblicazione: (2024)
di: Pi, Yulu
Pubblicazione: (2024)
BLM$_1$: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning
di: Tan, Wentao, et al.
Pubblicazione: (2025)
di: Tan, Wentao, et al.
Pubblicazione: (2025)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
DIO: Refining Mutual Information and Causal Chain to Enhance Machine Abstract Reasoning Ability
di: Song, Ruizhuo, et al.
Pubblicazione: (2025)
di: Song, Ruizhuo, et al.
Pubblicazione: (2025)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
di: Peng, Yi, et al.
Pubblicazione: (2025)
di: Peng, Yi, et al.
Pubblicazione: (2025)
CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs
di: Zhang, Daoan, et al.
Pubblicazione: (2024)
di: Zhang, Daoan, et al.
Pubblicazione: (2024)
Fast ECoT: Efficient Embodied Chain-of-Thought via Thoughts Reuse
di: Duan, Zhekai, et al.
Pubblicazione: (2025)
di: Duan, Zhekai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization
di: Ding, Ruiyi, et al.
Pubblicazione: (2026) -
ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning
di: Guan, Shaowei, et al.
Pubblicazione: (2025) -
Upfront Chain-of-Thought: A Cooperative Framework for Chain-of-Thought Compression
di: Li, Chengzhengxu, et al.
Pubblicazione: (2025) -
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
di: Xiong, Zhen, et al.
Pubblicazione: (2025) -
Tool-MCoT: Tool Augmented Multimodal Chain-of-Thought for Content Safety Moderation
di: Zhang, Shutong, et al.
Pubblicazione: (2026)