Guard Vector: Beyond English LLM Guardrails with Task-Vector Composition and Streaming-Aware Prefix SFT
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Wonhyuk, Kim, Youngchol, Park, Yunjin, Moon, Junhyung, Jeong, Dongyoung, Park, Wanjin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Responsible AI Technical Report
por: KT, et al.
Publicado: (2025)
por: KT, et al.
Publicado: (2025)
Adaptive Task Vectors for Large Language Models
por: Kang, Joonseong, et al.
Publicado: (2025)
por: Kang, Joonseong, et al.
Publicado: (2025)
SentGuard: Sentence-Level Streaming Guardrails for Large Language Models
por: Yu, Jiaqi, et al.
Publicado: (2026)
por: Yu, Jiaqi, et al.
Publicado: (2026)
MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety
por: Yang, Yahan, et al.
Publicado: (2025)
por: Yang, Yahan, et al.
Publicado: (2025)
ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails
por: Wang, Yan, et al.
Publicado: (2026)
por: Wang, Yan, et al.
Publicado: (2026)
BehaviorSFT: Behavioral Token Conditioning for Clinical Agents Across the Proactivity Spectrum
por: Kim, Yubin, et al.
Publicado: (2025)
por: Kim, Yubin, et al.
Publicado: (2025)
EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents
por: Choi, Dongwook, et al.
Publicado: (2026)
por: Choi, Dongwook, et al.
Publicado: (2026)
DuoGuard: A Two-Player RL-Driven Framework for Multilingual LLM Guardrails
por: Deng, Yihe, et al.
Publicado: (2025)
por: Deng, Yihe, et al.
Publicado: (2025)
Beyond Task-Oriented and Chitchat Dialogues: Proactive and Transition-Aware Conversational Agents
por: Yoon, Yejin, et al.
Publicado: (2025)
por: Yoon, Yejin, et al.
Publicado: (2025)
Task-Aware LoRA Adapter Composition via Similarity Retrieval in Vector Databases
por: Adsul, Riya, et al.
Publicado: (2026)
por: Adsul, Riya, et al.
Publicado: (2026)
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
por: Chen, Liang, et al.
Publicado: (2025)
por: Chen, Liang, et al.
Publicado: (2025)
Beyond One Path: Evaluating and Enhancing Divergent Thinking in Interactive LLM Agents
por: Park, Jihyeong, et al.
Publicado: (2026)
por: Park, Jihyeong, et al.
Publicado: (2026)
KLAAD: Refining Attention Mechanisms to Reduce Societal Bias in Generative Language Models
por: Kim, Seorin, et al.
Publicado: (2025)
por: Kim, Seorin, et al.
Publicado: (2025)
Rare-to-Frequent: Unlocking Compositional Generation Power of Diffusion Models on Rare Concepts with LLM Guidance
por: Park, Dongmin, et al.
Publicado: (2024)
por: Park, Dongmin, et al.
Publicado: (2024)
InstaTrans: An Instruction-Aware Translation Framework for Non-English Instruction Datasets
por: Kim, Yungi, et al.
Publicado: (2024)
por: Kim, Yungi, et al.
Publicado: (2024)
Does a Large Language Model Really Speak in Human-Like Language?
por: Park, Mose, et al.
Publicado: (2025)
por: Park, Mose, et al.
Publicado: (2025)
Prefixing Attention Sinks can Mitigate Activation Outliers for Large Language Model Quantization
por: Son, Seungwoo, et al.
Publicado: (2024)
por: Son, Seungwoo, et al.
Publicado: (2024)
Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection
por: Giarrusso, Francesco, et al.
Publicado: (2025)
por: Giarrusso, Francesco, et al.
Publicado: (2025)
LitE-SQL: A Lightweight and Efficient Text-to-SQL Framework with Vector-based Schema Linking and Execution-Guided Self-Correction
por: Piao, Shengmin, et al.
Publicado: (2025)
por: Piao, Shengmin, et al.
Publicado: (2025)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
por: Kim, Dongyoung, et al.
Publicado: (2024)
por: Kim, Dongyoung, et al.
Publicado: (2024)
Benchmarking LLM Guardrails in Handling Multilingual Toxicity
por: Yang, Yahan, et al.
Publicado: (2024)
por: Yang, Yahan, et al.
Publicado: (2024)
WebGuard: Building a Generalizable Guardrail for Web Agents
por: Zheng, Boyuan, et al.
Publicado: (2025)
por: Zheng, Boyuan, et al.
Publicado: (2025)
LLM-Enhanced Linear Autoencoders for Recommendation
por: Moon, Jaewan, et al.
Publicado: (2025)
por: Moon, Jaewan, et al.
Publicado: (2025)
EnSToM: Enhancing Dialogue Systems with Entropy-Scaled Steering Vectors for Topic Maintenance
por: Suh, Heejae, et al.
Publicado: (2025)
por: Suh, Heejae, et al.
Publicado: (2025)
Maximizing Local Entropy Where It Matters: Prefix-Aware Localized LLM Unlearning
por: Zhai, Naixin, et al.
Publicado: (2026)
por: Zhai, Naixin, et al.
Publicado: (2026)
Beyond Line-Level Filtering for the Pretraining Corpora of LLMs
por: Park, Chanwoo, et al.
Publicado: (2025)
por: Park, Chanwoo, et al.
Publicado: (2025)
Label Words as Local Task Vectors in In-Context Learning
por: Zheng, Bowen, et al.
Publicado: (2024)
por: Zheng, Bowen, et al.
Publicado: (2024)
ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails
por: Wen, Xiaofei, et al.
Publicado: (2025)
por: Wen, Xiaofei, et al.
Publicado: (2025)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
por: Oh, Sejoon, et al.
Publicado: (2024)
por: Oh, Sejoon, et al.
Publicado: (2024)
ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts
por: Aswal, Darpan, et al.
Publicado: (2025)
por: Aswal, Darpan, et al.
Publicado: (2025)
OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning
por: Zhu, Boyu, et al.
Publicado: (2025)
por: Zhu, Boyu, et al.
Publicado: (2025)
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
por: Kim, Wonjoong, et al.
Publicado: (2025)
por: Kim, Wonjoong, et al.
Publicado: (2025)
Moral Outrage Shapes Commitments Beyond Attention: Multimodal Moral Emotions on YouTube in Korea and the US
por: Park, Seongchan, et al.
Publicado: (2026)
por: Park, Seongchan, et al.
Publicado: (2026)
Linguistics-Aware Non-Distortionary LLM Watermarking
por: Park, Shinwoo, et al.
Publicado: (2026)
por: Park, Shinwoo, et al.
Publicado: (2026)
Task Vectors, Learned Not Extracted: Performance Gains and Mechanistic Insight
por: Yang, Haolin, et al.
Publicado: (2025)
por: Yang, Haolin, et al.
Publicado: (2025)
InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail Models
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors
por: Yegorova, Yekaterina, et al.
Publicado: (2026)
por: Yegorova, Yekaterina, et al.
Publicado: (2026)
PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention
por: Wang, Haonan, et al.
Publicado: (2025)
por: Wang, Haonan, et al.
Publicado: (2025)
Designing Role Vectors to Improve LLM Inference Behaviour
por: Potertì, Daniele, et al.
Publicado: (2025)
por: Potertì, Daniele, et al.
Publicado: (2025)
Advancing Beyond Identification: Multi-bit Watermark for Large Language Models
por: Yoo, KiYoon, et al.
Publicado: (2023)
por: Yoo, KiYoon, et al.
Publicado: (2023)
Ejemplares similares
-
Responsible AI Technical Report
por: KT, et al.
Publicado: (2025) -
Adaptive Task Vectors for Large Language Models
por: Kang, Joonseong, et al.
Publicado: (2025) -
SentGuard: Sentence-Level Streaming Guardrails for Large Language Models
por: Yu, Jiaqi, et al.
Publicado: (2026) -
MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety
por: Yang, Yahan, et al.
Publicado: (2025) -
ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails
por: Wang, Yan, et al.
Publicado: (2026)