Guardado en:
| Autores principales: | Wang, Haoyu, Qin, Zeyu, Shen, Li, Wang, Xueqian, Tao, Dacheng, Cheng, Minhao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.04040 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Lifelong Safety Alignment for Language Models
por: Wang, Haoyu, et al.
Publicado: (2025)
por: Wang, Haoyu, et al.
Publicado: (2025)
Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks
por: Liu, Haoyu, et al.
Publicado: (2026)
por: Liu, Haoyu, et al.
Publicado: (2026)
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
por: Kong, Yilun, et al.
Publicado: (2025)
por: Kong, Yilun, et al.
Publicado: (2025)
Multilingual Safety Alignment via Self-Distillation
por: Qin, Ruiyang, et al.
Publicado: (2026)
por: Qin, Ruiyang, et al.
Publicado: (2026)
Uncovering, Explaining, and Mitigating the Superficial Safety of Backdoor Defense
por: Min, Rui, et al.
Publicado: (2024)
por: Min, Rui, et al.
Publicado: (2024)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
por: Chen, Michael K., et al.
Publicado: (2025)
por: Chen, Michael K., et al.
Publicado: (2025)
Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?
por: Sun, Yiyou, et al.
Publicado: (2025)
por: Sun, Yiyou, et al.
Publicado: (2025)
Contextual Drag: How Errors in the Context Affect LLM Reasoning
por: Cheng, Yun, et al.
Publicado: (2026)
por: Cheng, Yun, et al.
Publicado: (2026)
RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility
por: He, Haoyu, et al.
Publicado: (2025)
por: He, Haoyu, et al.
Publicado: (2025)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
por: Tang, Anke, et al.
Publicado: (2024)
por: Tang, Anke, et al.
Publicado: (2024)
Scalable Token-Level Hallucination Detection in Large Language Models
por: Min, Rui, et al.
Publicado: (2026)
por: Min, Rui, et al.
Publicado: (2026)
Improving Large Language Models with Concept-Aware Fine-Tuning
por: Chen, Michael K., et al.
Publicado: (2025)
por: Chen, Michael K., et al.
Publicado: (2025)
Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities
por: Yang, Enneng, et al.
Publicado: (2024)
por: Yang, Enneng, et al.
Publicado: (2024)
PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization
por: Geng, Runpeng, et al.
Publicado: (2025)
por: Geng, Runpeng, et al.
Publicado: (2025)
Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning
por: Liu, Yong, et al.
Publicado: (2024)
por: Liu, Yong, et al.
Publicado: (2024)
Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning
por: Xing, Zeyu, et al.
Publicado: (2026)
por: Xing, Zeyu, et al.
Publicado: (2026)
Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings
por: Liu, Shikun, et al.
Publicado: (2025)
por: Liu, Shikun, et al.
Publicado: (2025)
Graphical Reasoning: LLM-based Semi-Open Relation Extraction
por: Tao, Yicheng, et al.
Publicado: (2024)
por: Tao, Yicheng, et al.
Publicado: (2024)
Steering Large Reasoning Models towards Concise Reasoning via Flow Matching
por: Li, Yawei, et al.
Publicado: (2026)
por: Li, Yawei, et al.
Publicado: (2026)
One Prompt is not Enough: Automated Construction of a Mixture-of-Expert Prompts
por: Wang, Ruochen, et al.
Publicado: (2024)
por: Wang, Ruochen, et al.
Publicado: (2024)
Efficient Reasoning with Hidden Thinking
por: Shen, Xuan, et al.
Publicado: (2025)
por: Shen, Xuan, et al.
Publicado: (2025)
Skywork Open Reasoner 1 Technical Report
por: He, Jujie, et al.
Publicado: (2025)
por: He, Jujie, et al.
Publicado: (2025)
SSR: Socratic Self-Refine for Large Language Model Reasoning
por: Shi, Haizhou, et al.
Publicado: (2025)
por: Shi, Haizhou, et al.
Publicado: (2025)
Mitigating Hallucinations in Large Language Models via Causal Reasoning
por: Li, Yuangang, et al.
Publicado: (2025)
por: Li, Yuangang, et al.
Publicado: (2025)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
por: Yang, Junxiao, et al.
Publicado: (2026)
por: Yang, Junxiao, et al.
Publicado: (2026)
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
por: Shen, Guobin, et al.
Publicado: (2026)
por: Shen, Guobin, et al.
Publicado: (2026)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
por: Chen, Jianhui, et al.
Publicado: (2024)
por: Chen, Jianhui, et al.
Publicado: (2024)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
por: Shen, Zhanming, et al.
Publicado: (2026)
por: Shen, Zhanming, et al.
Publicado: (2026)
RM-R1: Reward Modeling as Reasoning
por: Chen, Xiusi, et al.
Publicado: (2025)
por: Chen, Xiusi, et al.
Publicado: (2025)
What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning
por: Yuan, Yurun, et al.
Publicado: (2025)
por: Yuan, Yurun, et al.
Publicado: (2025)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
por: Wang, Yiping, et al.
Publicado: (2025)
por: Wang, Yiping, et al.
Publicado: (2025)
Exposing LLM Safety Gaps Through Mathematical Encoding:New Attacks and Systematic Analysis
por: Zhang, Haoyu, et al.
Publicado: (2026)
por: Zhang, Haoyu, et al.
Publicado: (2026)
DB-LLM: Accurate Dual-Binarization for Efficient LLMs
por: Chen, Hong, et al.
Publicado: (2024)
por: Chen, Hong, et al.
Publicado: (2024)
LongSafety: Enhance Safety for Long-Context LLMs
por: Huang, Mianqiu, et al.
Publicado: (2024)
por: Huang, Mianqiu, et al.
Publicado: (2024)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
por: Zhang, Jingyi, et al.
Publicado: (2025)
por: Zhang, Jingyi, et al.
Publicado: (2025)
Learning to Reason under Off-Policy Guidance
por: Yan, Jianhao, et al.
Publicado: (2025)
por: Yan, Jianhao, et al.
Publicado: (2025)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
por: Siu, Vincent, et al.
Publicado: (2025)
por: Siu, Vincent, et al.
Publicado: (2025)
ExGRPO: Learning to Reason from Experience
por: Zhan, Runzhe, et al.
Publicado: (2025)
por: Zhan, Runzhe, et al.
Publicado: (2025)
Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting
por: Wang, Cheng, et al.
Publicado: (2026)
por: Wang, Cheng, et al.
Publicado: (2026)
Ejemplares similares
-
Lifelong Safety Alignment for Language Models
por: Wang, Haoyu, et al.
Publicado: (2025) -
Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks
por: Liu, Haoyu, et al.
Publicado: (2026) -
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
por: Kong, Yilun, et al.
Publicado: (2025) -
Multilingual Safety Alignment via Self-Distillation
por: Qin, Ruiyang, et al.
Publicado: (2026) -
Uncovering, Explaining, and Mitigating the Superficial Safety of Backdoor Defense
por: Min, Rui, et al.
Publicado: (2024)