InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Boyuan, Hong, Donghai, Ji, Jiaming, Zheng, Jiacheng, Dong, Bowen, Zhou, Jiayi, Wang, Kaile, Dai, Juntao, Wang, Xuyao, Chen, Wenqi, Zheng, Qirui, Li, Wenxin, Han, Sirui, Guo, Yike, Yang, Yaodong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mitigating Deceptive Alignment via Self-Monitoring
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
di: Zhou, Jiayi, et al.
Pubblicazione: (2025)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
di: Ji, Jiaming, et al.
Pubblicazione: (2025)
Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
SafeMT: Multi-turn Safety for Multimodal Language Models
di: Zhu, Han, et al.
Pubblicazione: (2025)
di: Zhu, Han, et al.
Pubblicazione: (2025)
Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
di: Fang, Sitong, et al.
Pubblicazione: (2025)
di: Fang, Sitong, et al.
Pubblicazione: (2025)
ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs
di: Wen, Pengcheng, et al.
Pubblicazione: (2025)
di: Wen, Pengcheng, et al.
Pubblicazione: (2025)
Language Models Resist Alignment: Evidence From Data Compression
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning
di: Fang, Sitong, et al.
Pubblicazione: (2025)
di: Fang, Sitong, et al.
Pubblicazione: (2025)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
di: Dai, Josef, et al.
Pubblicazione: (2024)
di: Dai, Josef, et al.
Pubblicazione: (2024)
SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
di: Bu, Yuyan, et al.
Pubblicazione: (2026)
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
di: Lou, Hantao, et al.
Pubblicazione: (2025)
di: Lou, Hantao, et al.
Pubblicazione: (2025)
Aligner: Efficient Alignment by Learning to Correct
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models
di: Yang, Tianzhuo, et al.
Pubblicazione: (2026)
di: Yang, Tianzhuo, et al.
Pubblicazione: (2026)
SQL-Trail: Multi-Turn Reinforcement Learning with Interleaved Feedback for Text-to-SQL
di: Hua, Harper, et al.
Pubblicazione: (2026)
di: Hua, Harper, et al.
Pubblicazione: (2026)
SafeLawBench: Towards Safe Alignment of Large Language Models
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
di: Cao, Chuxue, et al.
Pubblicazione: (2025)
InterFeedback: Unveiling Interactive Intelligence of Large Multimodal Models via Human Feedback
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2025)
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2025)
Pref-GUIDE: Continual Policy Learning from Real-Time Human Feedback via Preference-Based Learning
di: Ji, Zhengran, et al.
Pubblicazione: (2025)
di: Ji, Zhengran, et al.
Pubblicazione: (2025)
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
di: Dai, Juntao, et al.
Pubblicazione: (2025)
di: Dai, Juntao, et al.
Pubblicazione: (2025)
Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation
di: Dai, Juntao, et al.
Pubblicazione: (2024)
di: Dai, Juntao, et al.
Pubblicazione: (2024)
ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
di: Wu, Yike, et al.
Pubblicazione: (2025)
di: Wu, Yike, et al.
Pubblicazione: (2025)
VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
A Game-Theoretic Negotiation Framework for Cross-Cultural Consensus in LLMs
di: Zhang, Guoxi, et al.
Pubblicazione: (2025)
di: Zhang, Guoxi, et al.
Pubblicazione: (2025)
HY-MT1.5 Technical Report
di: Zheng, Mao, et al.
Pubblicazione: (2025)
di: Zheng, Mao, et al.
Pubblicazione: (2025)
Reward Generalization in RLHF: A Topological Perspective
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
di: Qiu, Tianyi, et al.
Pubblicazione: (2024)
KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues
di: Chen, Junhao, et al.
Pubblicazione: (2025)
di: Chen, Junhao, et al.
Pubblicazione: (2025)
Seg-ReSearch: Segmentation with Interleaved Reasoning and External Search
di: Liang, Tianming, et al.
Pubblicazione: (2026)
di: Liang, Tianming, et al.
Pubblicazione: (2026)
Optimizing Inter-chip Coupler Link Placement for Modular and Chiplet Quantum Systems
di: Du, Zefan, et al.
Pubblicazione: (2025)
di: Du, Zefan, et al.
Pubblicazione: (2025)
AI Alignment: A Comprehensive Survey
di: Ji, Jiaming, et al.
Pubblicazione: (2023)
di: Ji, Jiaming, et al.
Pubblicazione: (2023)
Pushing the Boundaries of Natural Reasoning: Interleaved Bonus from Formal-Logic Verification
di: Cao, Chuxue, et al.
Pubblicazione: (2026)
di: Cao, Chuxue, et al.
Pubblicazione: (2026)
STAS: Spatial-Temporal Return Decomposition for Multi-agent Reinforcement Learning
di: Chen, Sirui, et al.
Pubblicazione: (2023)
di: Chen, Sirui, et al.
Pubblicazione: (2023)
Parallel Disputes, Divergent Outcomes: The EU's Automobile Trade Conflicts with Korea and China
di: Jiyong Zheng, et al.
Pubblicazione: (2025)
di: Jiyong Zheng, et al.
Pubblicazione: (2025)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
di: Shi, Yudi, et al.
Pubblicazione: (2026)
di: Shi, Yudi, et al.
Pubblicazione: (2026)
ShuttleEnv: An Interactive Data-Driven RL Environment for Badminton Strategy Modeling
di: Li, Ang, et al.
Pubblicazione: (2026)
di: Li, Ang, et al.
Pubblicazione: (2026)
LAPP: Large Language Model Feedback for Preference-Driven Reinforcement Learning
di: Jian, Pingcheng, et al.
Pubblicazione: (2025)
di: Jian, Pingcheng, et al.
Pubblicazione: (2025)
Amulet: ReAlignment During Test Time for Personalized Preference Adaptation of LLMs
di: Zhang, Zhaowei, et al.
Pubblicazione: (2025)
di: Zhang, Zhaowei, et al.
Pubblicazione: (2025)
From Multimodal Perception to Strategic Reasoning: A Survey on AI-Generated Game Commentary
di: Zheng, Qirui, et al.
Pubblicazione: (2025)
di: Zheng, Qirui, et al.
Pubblicazione: (2025)
High‐Isolation Multidimensional Holography Multiplexing in Non‐Interleaved Metasurfaces
di: Tongwen Zheng, et al.
Pubblicazione: (2025)
di: Tongwen Zheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mitigating Deceptive Alignment via Self-Monitoring
di: Ji, Jiaming, et al.
Pubblicazione: (2025) -
Generative RLHF-V: Learning Principles from Multi-modal Human Preference
di: Zhou, Jiayi, et al.
Pubblicazione: (2025) -
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024) -
Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2025) -
Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2024)