Discovering Agentic Safety Specifications from 1-Bit Danger Signals
Fuente:
arXiv
Guardado en:
| Autor principal: | Gallego, Víctor |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MetaSC: Test-Time Safety Specification Optimization for Language Models
por: Gallego, Víctor
Publicado: (2025)
por: Gallego, Víctor
Publicado: (2025)
Configurable Safety Tuning of Language Models with Synthetic Preference Data
por: Gallego, Victor
Publicado: (2024)
por: Gallego, Victor
Publicado: (2024)
Specification Self-Correction: Mitigating In-Context Reward Hacking Through Test-Time Refinement
por: Gallego, Víctor
Publicado: (2025)
por: Gallego, Víctor
Publicado: (2025)
Configurable Preference Tuning with Rubric-Guided Synthetic Data
por: Gallego, Víctor
Publicado: (2025)
por: Gallego, Víctor
Publicado: (2025)
Merging Improves Self-Critique Against Jailbreak Attacks
por: Gallego, Victor
Publicado: (2024)
por: Gallego, Victor
Publicado: (2024)
Signals: Trajectory Sampling and Triage for Agentic Interactions
por: Chen, Shuguang, et al.
Publicado: (2026)
por: Chen, Shuguang, et al.
Publicado: (2026)
LLM Can be a Dangerous Persuader: Empirical Study of Persuasion Safety in Large Language Models
por: Liu, Minqian, et al.
Publicado: (2025)
por: Liu, Minqian, et al.
Publicado: (2025)
ARM: Discovering Agentic Reasoning Modules for Generalizable Multi-Agent Systems
por: Yao, Bohan, et al.
Publicado: (2025)
por: Yao, Bohan, et al.
Publicado: (2025)
RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG
por: Gao, Joshua, et al.
Publicado: (2025)
por: Gao, Joshua, et al.
Publicado: (2025)
LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
por: Wong, Sing Hieng, et al.
Publicado: (2026)
por: Wong, Sing Hieng, et al.
Publicado: (2026)
Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment
por: Banerjee, Somnath, et al.
Publicado: (2025)
por: Banerjee, Somnath, et al.
Publicado: (2025)
Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization
por: Agarwal, Anmol, et al.
Publicado: (2026)
por: Agarwal, Anmol, et al.
Publicado: (2026)
Agentic Adversarial QA for Improving Domain-Specific LLMs
por: Grari, Vincent, et al.
Publicado: (2026)
por: Grari, Vincent, et al.
Publicado: (2026)
Uncovering the Potential Risks in Unlearning: Danger of English-only Unlearning in Multilingual LLMs
por: Hwang, Kyomin, et al.
Publicado: (2025)
por: Hwang, Kyomin, et al.
Publicado: (2025)
Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4
por: Liu, Chengwu, et al.
Publicado: (2026)
por: Liu, Chengwu, et al.
Publicado: (2026)
SWE-AGI: Benchmarking Specification-Driven Software Construction with MoonBit in the Era of Autonomous Agents
por: Zhang, Zhirui, et al.
Publicado: (2026)
por: Zhang, Zhirui, et al.
Publicado: (2026)
Bi-Mamba: Towards Accurate 1-Bit State Space Models
por: Tang, Shengkun, et al.
Publicado: (2024)
por: Tang, Shengkun, et al.
Publicado: (2024)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
por: Peng, Hao, et al.
Publicado: (2025)
por: Peng, Hao, et al.
Publicado: (2025)
Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs
por: Said, Muhammad Abdullahi, et al.
Publicado: (2025)
por: Said, Muhammad Abdullahi, et al.
Publicado: (2025)
Output Length Effect on DeepSeek-R1's Safety in Forced Thinking
por: Li, Xuying, et al.
Publicado: (2025)
por: Li, Xuying, et al.
Publicado: (2025)
Using LLMs to Discover Legal Factors
por: Gray, Morgan, et al.
Publicado: (2024)
por: Gray, Morgan, et al.
Publicado: (2024)
Subjective $\textit{Isms}$? On the Danger of Conflating Hate and Offence in Abusive Language Detection
por: Curry, Amanda Cercas, et al.
Publicado: (2024)
por: Curry, Amanda Cercas, et al.
Publicado: (2024)
An Agentic AI Framework for Training General Practitioner Student Skills
por: De Marez, Victor, et al.
Publicado: (2025)
por: De Marez, Victor, et al.
Publicado: (2025)
Discovering Significant Topics from Legal Decisions with Selective Inference
por: Soh, Jerrold
Publicado: (2024)
por: Soh, Jerrold
Publicado: (2024)
LittleBit: Ultra Low-Bit Quantization via Latent Factorization
por: Lee, Banseok, et al.
Publicado: (2025)
por: Lee, Banseok, et al.
Publicado: (2025)
Budget-Aware Agentic Routing via Boundary-Guided Training
por: Zhang, Caiqi, et al.
Publicado: (2026)
por: Zhang, Caiqi, et al.
Publicado: (2026)
AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models
por: Zhang, Jinchuan, et al.
Publicado: (2025)
por: Zhang, Jinchuan, et al.
Publicado: (2025)
Resisting Correction: How RLHF Makes Language Models Ignore External Safety Signals in Natural Conversation
por: Cataneo, Felipe Biava
Publicado: (2025)
por: Cataneo, Felipe Biava
Publicado: (2025)
NILC: Discovering New Intents with LLM-assisted Clustering
por: Wang, Hongtao, et al.
Publicado: (2025)
por: Wang, Hongtao, et al.
Publicado: (2025)
SafeLLM: Domain-Specific Safety Monitoring for Large Language Models: A Case Study of Offshore Wind Maintenance
por: Walker, Connor, et al.
Publicado: (2024)
por: Walker, Connor, et al.
Publicado: (2024)
Safety Alignment Can Be Not Superficial With Explicit Safety Signals
por: Li, Jianwei, et al.
Publicado: (2025)
por: Li, Jianwei, et al.
Publicado: (2025)
Discovering Process-Outcome Credit in Multi-Step LLM Reasoning
por: Wang, Xiangwei, et al.
Publicado: (2026)
por: Wang, Xiangwei, et al.
Publicado: (2026)
Precision Knowledge Editing: Enhancing Safety in Large Language Models
por: Li, Xuying, et al.
Publicado: (2024)
por: Li, Xuying, et al.
Publicado: (2024)
LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
por: Sun, Lihao, et al.
Publicado: (2026)
por: Sun, Lihao, et al.
Publicado: (2026)
Agentic Confidence Calibration
por: Zhang, Jiaxin, et al.
Publicado: (2026)
por: Zhang, Jiaxin, et al.
Publicado: (2026)
Agentic Uncertainty Quantification
por: Zhang, Jiaxin, et al.
Publicado: (2026)
por: Zhang, Jiaxin, et al.
Publicado: (2026)
AgenticSum: An Agentic Inference-Time Framework for Faithful Clinical Text Summarization
por: Piya, Fahmida Liza, et al.
Publicado: (2026)
por: Piya, Fahmida Liza, et al.
Publicado: (2026)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
por: Wu, Junde, et al.
Publicado: (2025)
por: Wu, Junde, et al.
Publicado: (2025)
Can Reinforcement Learning Unlock the Hidden Dangers in Aligned Large Language Models?
por: Karkevandi, Mohammad Bahrami, et al.
Publicado: (2024)
por: Karkevandi, Mohammad Bahrami, et al.
Publicado: (2024)
R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge
por: In, Yeonjun, et al.
Publicado: (2025)
por: In, Yeonjun, et al.
Publicado: (2025)
Ejemplares similares
-
MetaSC: Test-Time Safety Specification Optimization for Language Models
por: Gallego, Víctor
Publicado: (2025) -
Configurable Safety Tuning of Language Models with Synthetic Preference Data
por: Gallego, Victor
Publicado: (2024) -
Specification Self-Correction: Mitigating In-Context Reward Hacking Through Test-Time Refinement
por: Gallego, Víctor
Publicado: (2025) -
Configurable Preference Tuning with Rubric-Guided Synthetic Data
por: Gallego, Víctor
Publicado: (2025) -
Merging Improves Self-Critique Against Jailbreak Attacks
por: Gallego, Victor
Publicado: (2024)