Enregistré dans:
| Auteurs principaux: | Xie, Yingsha, Huang, Tiansheng, Yang, Enneng, Min, Rui, Lu, Wenjie, Cao, Xiaochun, Tan, Naiqiang, Shen, Li |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.02136 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
par: Wang, Yibo, et autres
Publié: (2025)
par: Wang, Yibo, et autres
Publié: (2025)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search
par: Wang, Yibo, et autres
Publié: (2025)
par: Wang, Yibo, et autres
Publié: (2025)
Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning Optimization
par: Luo, Haotian, et autres
Publié: (2025)
par: Luo, Haotian, et autres
Publié: (2025)
O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning
par: Luo, Haotian, et autres
Publié: (2025)
par: Luo, Haotian, et autres
Publié: (2025)
Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities
par: Yang, Enneng, et autres
Publié: (2024)
par: Yang, Enneng, et autres
Publié: (2024)
OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging
par: Wei, Yongxian, et autres
Publié: (2025)
par: Wei, Yongxian, et autres
Publié: (2025)
Surgery: Mitigating Harmful Fine-Tuning for Large Language Models via Attention Sink
par: Liu, Guozhi, et autres
Publié: (2026)
par: Liu, Guozhi, et autres
Publié: (2026)
Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation
par: Liu, Guozhi, et autres
Publié: (2024)
par: Liu, Guozhi, et autres
Publié: (2024)
Bag of Tricks for Inference-time Computation of LLM Reasoning
par: Liu, Fan, et autres
Publié: (2025)
par: Liu, Fan, et autres
Publié: (2025)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
par: Ning, Yansong, et autres
Publié: (2025)
par: Ning, Yansong, et autres
Publié: (2025)
SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment
par: Fang, Xianya, et autres
Publié: (2026)
par: Fang, Xianya, et autres
Publié: (2026)
Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging
par: Shen, Li, et autres
Publié: (2024)
par: Shen, Li, et autres
Publié: (2024)
Model Unmerging: Making Your Models Unmergeable for Secure Model Sharing
par: Wang, Zihao, et autres
Publié: (2025)
par: Wang, Zihao, et autres
Publié: (2025)
Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization
par: Wu, Junyan, et autres
Publié: (2024)
par: Wu, Junyan, et autres
Publié: (2024)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
par: Luo, Haotian, et autres
Publié: (2025)
par: Luo, Haotian, et autres
Publié: (2025)
Distributionally Robust Graph Out-of-Distribution Recommendation via Diffusion Model
par: Zhao, Chu, et autres
Publié: (2025)
par: Zhao, Chu, et autres
Publié: (2025)
Auto-Search and Refinement: An Automated Framework for Gender Bias Mitigation in Large Language Models
par: Xu, Yue, et autres
Publié: (2025)
par: Xu, Yue, et autres
Publié: (2025)
When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models
par: Mao, Yingzhi, et autres
Publié: (2025)
par: Mao, Yingzhi, et autres
Publié: (2025)
Hard Negative Sampling via Large Language Models for Recommendation
par: Zhao, Chu, et autres
Publié: (2025)
par: Zhao, Chu, et autres
Publié: (2025)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
par: Liu, Guozhi, et autres
Publié: (2025)
par: Liu, Guozhi, et autres
Publié: (2025)
A Comprehensive Survey of Forgetting in Deep Learning Beyond Continual Learning
par: Wang, Zhenyi, et autres
Publié: (2023)
par: Wang, Zhenyi, et autres
Publié: (2023)
Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning
par: Luo, Qin-Wen, et autres
Publié: (2026)
par: Luo, Qin-Wen, et autres
Publié: (2026)
Beyond the Safety Tax: Mitigating Unsafe Text-to-Image Generation via External Safety Rectification
par: Meng, Xiangtao, et autres
Publié: (2025)
par: Meng, Xiangtao, et autres
Publié: (2025)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
par: Lou, Xinyue, et autres
Publié: (2025)
par: Lou, Xinyue, et autres
Publié: (2025)
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
MeasHalu: Mitigation of Scientific Measurement Hallucinations for Large Language Models with Enhanced Reasoning
par: Huang, Ruijun, et autres
Publié: (2026)
par: Huang, Ruijun, et autres
Publié: (2026)
Online Merging Optimizers for Boosting Rewards and Mitigating Tax in Alignment
par: Lu, Keming, et autres
Publié: (2024)
par: Lu, Keming, et autres
Publié: (2024)
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
par: Xi, Zhiheng, et autres
Publié: (2023)
par: Xi, Zhiheng, et autres
Publié: (2023)
Long Is More Important Than Difficult for Training Reasoning Models
par: Shen, Si, et autres
Publié: (2025)
par: Shen, Si, et autres
Publié: (2025)
Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation
par: Mao, Jiawei, et autres
Publié: (2026)
par: Mao, Jiawei, et autres
Publié: (2026)
Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection
par: Sun, Guanglong, et autres
Publié: (2026)
par: Sun, Guanglong, et autres
Publié: (2026)
Causal Direct Preference Optimization for Distributionally Robust Generative Recommendation
par: Zhao, Chu, et autres
Publié: (2026)
par: Zhao, Chu, et autres
Publié: (2026)
Automatic Pruning Discovery for Large Language Models
par: Kang, Haidong, et autres
Publié: (2025)
par: Kang, Haidong, et autres
Publié: (2025)
Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering
par: Li, Xiaomin, et autres
Publié: (2026)
par: Li, Xiaomin, et autres
Publié: (2026)
PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models
par: Hu, Sihao, et autres
Publié: (2024)
par: Hu, Sihao, et autres
Publié: (2024)
Uncovering, Explaining, and Mitigating the Superficial Safety of Backdoor Defense
par: Min, Rui, et autres
Publié: (2024)
par: Min, Rui, et autres
Publié: (2024)
Systematic Engineering of Escherichia coli to Enhance 1,6‐Hexamethylenediamine Biosynthesis and Mitigate Byproduct 1,5‐Pentanediamine
par: Zanwen Chen, et autres
Publié: (2026)
par: Zanwen Chen, et autres
Publié: (2026)
Documents similaires
-
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
par: Wang, Yibo, et autres
Publié: (2025) -
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
par: Huang, Tiansheng, et autres
Publié: (2025) -
R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search
par: Wang, Yibo, et autres
Publié: (2025) -
Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning Optimization
par: Luo, Haotian, et autres
Publié: (2025) -
O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning
par: Luo, Haotian, et autres
Publié: (2025)