Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Fang, Sitong, Hou, Shiyi, Wang, Kaile, Chen, Boyuan, Hong, Donghai, Zhou, Jiayi, Dai, Josef, Yang, Yaodong, Ji, Jiaming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mitigating Deceptive Alignment via Self-Monitoring
por: Ji, Jiaming, et al.
Publicado: (2025)
por: Ji, Jiaming, et al.
Publicado: (2025)
Language Models Resist Alignment: Evidence From Data Compression
por: Ji, Jiaming, et al.
Publicado: (2024)
por: Ji, Jiaming, et al.
Publicado: (2024)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
por: Zhou, Jiayi, et al.
Publicado: (2024)
por: Zhou, Jiayi, et al.
Publicado: (2024)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
por: Ji, Jiaming, et al.
Publicado: (2024)
por: Ji, Jiaming, et al.
Publicado: (2024)
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
por: Zhou, Jiayi, et al.
Publicado: (2025)
por: Zhou, Jiayi, et al.
Publicado: (2025)
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
por: Lou, Hantao, et al.
Publicado: (2025)
por: Lou, Hantao, et al.
Publicado: (2025)
Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
por: Ji, Jiaming, et al.
Publicado: (2024)
por: Ji, Jiaming, et al.
Publicado: (2024)
Reward Generalization in RLHF: A Topological Perspective
por: Qiu, Tianyi, et al.
Publicado: (2024)
por: Qiu, Tianyi, et al.
Publicado: (2024)
InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
por: Chen, Boyuan, et al.
Publicado: (2025)
por: Chen, Boyuan, et al.
Publicado: (2025)
Aligner: Efficient Alignment by Learning to Correct
por: Ji, Jiaming, et al.
Publicado: (2024)
por: Ji, Jiaming, et al.
Publicado: (2024)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
por: Ji, Jiaming, et al.
Publicado: (2025)
por: Ji, Jiaming, et al.
Publicado: (2025)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
por: Lou, Hantao, et al.
Publicado: (2025)
por: Lou, Hantao, et al.
Publicado: (2025)
SafeMT: Multi-turn Safety for Multimodal Language Models
por: Zhu, Han, et al.
Publicado: (2025)
por: Zhu, Han, et al.
Publicado: (2025)
MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models
por: Yang, Tianzhuo, et al.
Publicado: (2026)
por: Yang, Tianzhuo, et al.
Publicado: (2026)
When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning
por: Fang, Sitong, et al.
Publicado: (2025)
por: Fang, Sitong, et al.
Publicado: (2025)
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
por: Zhang, Borong, et al.
Publicado: (2025)
por: Zhang, Borong, et al.
Publicado: (2025)
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
por: Wen, Pengcheng, et al.
Publicado: (2025)
por: Wen, Pengcheng, et al.
Publicado: (2025)
SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence
por: Bu, Yuyan, et al.
Publicado: (2026)
por: Bu, Yuyan, et al.
Publicado: (2026)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
por: Dai, Josef, et al.
Publicado: (2024)
por: Dai, Josef, et al.
Publicado: (2024)
AI Deception: Risks, Dynamics, and Controls
por: Chen, Boyuan, et al.
Publicado: (2025)
por: Chen, Boyuan, et al.
Publicado: (2025)
Evolving Deception: When Agents Evolve, Deception Wins
por: Ying, Zonghao, et al.
Publicado: (2026)
por: Ying, Zonghao, et al.
Publicado: (2026)
AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
por: Zhou, Ziyin, et al.
Publicado: (2025)
por: Zhou, Ziyin, et al.
Publicado: (2025)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
por: Zhang, Yuhao, et al.
Publicado: (2026)
por: Zhang, Yuhao, et al.
Publicado: (2026)
SafeLawBench: Towards Safe Alignment of Large Language Models
por: Cao, Chuxue, et al.
Publicado: (2025)
por: Cao, Chuxue, et al.
Publicado: (2025)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
por: Li, Jiale, et al.
Publicado: (2025)
por: Li, Jiale, et al.
Publicado: (2025)
Towards Explainable Harmful Meme Detection through Multimodal Debate between Large Language Models
por: Lin, Hongzhan, et al.
Publicado: (2024)
por: Lin, Hongzhan, et al.
Publicado: (2024)
Stable Reasoning, Unstable Responses: Mitigating LLM Deception via Stability Asymmetry
por: Zhang, Guoxi, et al.
Publicado: (2026)
por: Zhang, Guoxi, et al.
Publicado: (2026)
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
por: Chen, Jiawei, et al.
Publicado: (2026)
por: Chen, Jiawei, et al.
Publicado: (2026)
A Game-Theoretic Negotiation Framework for Cross-Cultural Consensus in LLMs
por: Zhang, Guoxi, et al.
Publicado: (2025)
por: Zhang, Guoxi, et al.
Publicado: (2025)
SafeDreamer: Safe Reinforcement Learning with World Models
por: Huang, Weidong, et al.
Publicado: (2023)
por: Huang, Weidong, et al.
Publicado: (2023)
Dynamic Emotion and Personality Profiling for Multimodal Deception Detection
por: Zheng, Li, et al.
Publicado: (2026)
por: Zheng, Li, et al.
Publicado: (2026)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
por: You, Liangliang, et al.
Publicado: (2025)
por: You, Liangliang, et al.
Publicado: (2025)
$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models
por: Luo, Yaxin, et al.
Publicado: (2024)
por: Luo, Yaxin, et al.
Publicado: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2025)
por: Wu, Qiong, et al.
Publicado: (2025)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
por: Zhang, Borong, et al.
Publicado: (2025)
por: Zhang, Borong, et al.
Publicado: (2025)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
por: Ma, Yiwei, et al.
Publicado: (2024)
por: Ma, Yiwei, et al.
Publicado: (2024)
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
por: Wang, Zhaoxin, et al.
Publicado: (2026)
por: Wang, Zhaoxin, et al.
Publicado: (2026)
Training-Free Multimodal Large Language Model Orchestration
por: Xie, Tianyu, et al.
Publicado: (2025)
por: Xie, Tianyu, et al.
Publicado: (2025)
SpecDiff: Accelerating Diffusion Model Inference with Self-Speculation
por: Pan, Jiayi, et al.
Publicado: (2025)
por: Pan, Jiayi, et al.
Publicado: (2025)
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
por: Xu, Jiaming, et al.
Publicado: (2025)
por: Xu, Jiaming, et al.
Publicado: (2025)
Ejemplares similares
-
Mitigating Deceptive Alignment via Self-Monitoring
por: Ji, Jiaming, et al.
Publicado: (2025) -
Language Models Resist Alignment: Evidence From Data Compression
por: Ji, Jiaming, et al.
Publicado: (2024) -
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
por: Zhou, Jiayi, et al.
Publicado: (2024) -
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
por: Ji, Jiaming, et al.
Publicado: (2024) -
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
por: Zhou, Jiayi, et al.
Publicado: (2025)