SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ding, Peng, Sun, Wen, Li, Dailin, Zou, Wei, Wang, Jiaming, Chen, Jiajun, Huang, Shujian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring the Factual Consistency in Dialogue Comprehension of Large Language Models
di: She, Shuaijie, et al.
Pubblicazione: (2023)
di: She, Shuaijie, et al.
Pubblicazione: (2023)
Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data
di: Zou, Wei, et al.
Pubblicazione: (2025)
di: Zou, Wei, et al.
Pubblicazione: (2025)
Extend Adversarial Policy Against Neural Machine Translation via Unknown Token
di: Zou, Wei, et al.
Pubblicazione: (2025)
di: Zou, Wei, et al.
Pubblicazione: (2025)
Large Language Models are Limited in Out-of-Context Knowledge Reasoning
di: Hu, Peng, et al.
Pubblicazione: (2024)
di: Hu, Peng, et al.
Pubblicazione: (2024)
Formality is Favored: Unraveling the Learning Preferences of Large Language Models on Data with Conflicting Knowledge
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
Why Not Act on What You Know? Unleashing Safety Potential of LLMs via Self-Aware Guard Enhancement
di: Ding, Peng, et al.
Pubblicazione: (2025)
di: Ding, Peng, et al.
Pubblicazione: (2025)
MT-PATCHER: Selective and Extendable Knowledge Distillation from Large Language Models for Machine Translation
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack
di: Ding, Peng, et al.
Pubblicazione: (2025)
di: Ding, Peng, et al.
Pubblicazione: (2025)
Measuring Meaning Composition in the Human Brain with Composition Scores from Large Language Models
di: Gao, Changjiang, et al.
Pubblicazione: (2024)
di: Gao, Changjiang, et al.
Pubblicazione: (2024)
Eliciting the Translation Ability of Large Language Models via Multilingual Finetuning with Translation Instructions
di: Li, Jiahuan, et al.
Pubblicazione: (2023)
di: Li, Jiahuan, et al.
Pubblicazione: (2023)
A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily
di: Ding, Peng, et al.
Pubblicazione: (2023)
di: Ding, Peng, et al.
Pubblicazione: (2023)
Lost in the Source Language: How Large Language Models Evaluate the Quality of Machine Translation
di: Huang, Xu, et al.
Pubblicazione: (2024)
di: Huang, Xu, et al.
Pubblicazione: (2024)
MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference Optimization
di: She, Shuaijie, et al.
Pubblicazione: (2024)
di: She, Shuaijie, et al.
Pubblicazione: (2024)
TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning
di: Huang, Xu, et al.
Pubblicazione: (2026)
di: Huang, Xu, et al.
Pubblicazione: (2026)
Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis
di: Zhu, Wenhao, et al.
Pubblicazione: (2023)
di: Zhu, Wenhao, et al.
Pubblicazione: (2023)
Ranked Voting based Self-Consistency of Large Language Models
di: Wang, Weiqin, et al.
Pubblicazione: (2025)
di: Wang, Weiqin, et al.
Pubblicazione: (2025)
MoE-LPR: Multilingual Extension of Large Language Models through Mixture-of-Experts with Language Priors Routing
di: Zhou, Hao, et al.
Pubblicazione: (2024)
di: Zhou, Hao, et al.
Pubblicazione: (2024)
Improved Paraphrase Generation via Controllable Latent Diffusion
di: Zou, Wei, et al.
Pubblicazione: (2024)
di: Zou, Wei, et al.
Pubblicazione: (2024)
Efficient Tuning of Large Language Models for Knowledge-Grounded Dialogue Generation
di: Zhang, Bo, et al.
Pubblicazione: (2025)
di: Zhang, Bo, et al.
Pubblicazione: (2025)
ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection
di: Gao, Changjiang, et al.
Pubblicazione: (2026)
di: Gao, Changjiang, et al.
Pubblicazione: (2026)
Enhancing Semantic Consistency of Large Language Models through Model Editing: An Interpretability-Oriented Approach
di: Yang, Jingyuan, et al.
Pubblicazione: (2025)
di: Yang, Jingyuan, et al.
Pubblicazione: (2025)
Getting More from Less: Large Language Models are Good Spontaneous Multilingual Learners
di: Zhang, Shimao, et al.
Pubblicazione: (2024)
di: Zhang, Shimao, et al.
Pubblicazione: (2024)
EDT: Improving Large Language Models' Generation by Entropy-based Dynamic Temperature Sampling
di: Zhang, Shimao, et al.
Pubblicazione: (2024)
di: Zhang, Shimao, et al.
Pubblicazione: (2024)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
di: Diao, Muxi, et al.
Pubblicazione: (2024)
di: Diao, Muxi, et al.
Pubblicazione: (2024)
Extroversion or Introversion? Controlling The Personality of Your Large Language Models
di: Chen, Yanquan, et al.
Pubblicazione: (2024)
di: Chen, Yanquan, et al.
Pubblicazione: (2024)
Multi-Candidate Speculative Decoding
di: Yang, Sen, et al.
Pubblicazione: (2024)
di: Yang, Sen, et al.
Pubblicazione: (2024)
Why Not Transform Chat Large Language Models to Non-English?
di: Geng, Xiang, et al.
Pubblicazione: (2024)
di: Geng, Xiang, et al.
Pubblicazione: (2024)
Multilingual Pretraining and Instruction Tuning Improve Cross-Lingual Knowledge Alignment, But Only Shallowly
di: Gao, Changjiang, et al.
Pubblicazione: (2024)
di: Gao, Changjiang, et al.
Pubblicazione: (2024)
Internal Consistency and Self-Feedback in Large Language Models: A Survey
di: Liang, Xun, et al.
Pubblicazione: (2024)
di: Liang, Xun, et al.
Pubblicazione: (2024)
EnAnchored-X2X: English-Anchored Optimization for Many-to-Many Translation
di: Yang, Sen, et al.
Pubblicazione: (2025)
di: Yang, Sen, et al.
Pubblicazione: (2025)
Self-Evolution Knowledge Distillation for LLM-based Machine Translation
di: Song, Yuncheng, et al.
Pubblicazione: (2024)
di: Song, Yuncheng, et al.
Pubblicazione: (2024)
Multilingual Contrastive Decoding via Language-Agnostic Layers Skipping
di: Zhu, Wenhao, et al.
Pubblicazione: (2024)
di: Zhu, Wenhao, et al.
Pubblicazione: (2024)
R-PRM: Reasoning-Driven Process Reward Modeling
di: She, Shuaijie, et al.
Pubblicazione: (2025)
di: She, Shuaijie, et al.
Pubblicazione: (2025)
PreAlign: Boosting Cross-Lingual Transfer by Early Establishment of Multilingual Alignment
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
Large Language Models Are Cross-Lingual Knowledge-Free Reasoners
di: Hu, Peng, et al.
Pubblicazione: (2024)
di: Hu, Peng, et al.
Pubblicazione: (2024)
PATS: Process-Level Adaptive Thinking Mode Switching
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
ConsistentChat: Building Skeleton-Guided Consistent Multi-Turn Dialogues for Large Language Models from Scratch
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
SafetyBench: Evaluating the Safety of Large Language Models
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
Evontree: Ontology Rule-Guided Self-Evolution of Large Language Models
di: Tu, Mingchen, et al.
Pubblicazione: (2025)
di: Tu, Mingchen, et al.
Pubblicazione: (2025)
SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures
di: Wang, Jiaming, et al.
Pubblicazione: (2025)
di: Wang, Jiaming, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Exploring the Factual Consistency in Dialogue Comprehension of Large Language Models
di: She, Shuaijie, et al.
Pubblicazione: (2023) -
Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data
di: Zou, Wei, et al.
Pubblicazione: (2025) -
Extend Adversarial Policy Against Neural Machine Translation via Unknown Token
di: Zou, Wei, et al.
Pubblicazione: (2025) -
Large Language Models are Limited in Out-of-Context Knowledge Reasoning
di: Hu, Peng, et al.
Pubblicazione: (2024) -
Formality is Favored: Unraveling the Learning Preferences of Large Language Models on Data with Conflicting Knowledge
di: Li, Jiahuan, et al.
Pubblicazione: (2024)