FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Jinwei, Huang, Zhenglin, Yin, Xiangyu, Ruan, Wenjie, Cheng, Guangliang, Dong, Yi, Huang, Xiaowei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models
por: Li, Zhuoyun, et al.
Publicado: (2026)
por: Li, Zhuoyun, et al.
Publicado: (2026)
Trust-Oriented Adaptive Guardrails for Large Language Models
por: Hu, Jinwei, et al.
Publicado: (2024)
por: Hu, Jinwei, et al.
Publicado: (2024)
Building Guardrails for Large Language Models
por: Dong, Yi, et al.
Publicado: (2024)
por: Dong, Yi, et al.
Publicado: (2024)
Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage
por: Hu, Jinwei, et al.
Publicado: (2026)
por: Hu, Jinwei, et al.
Publicado: (2026)
CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models
por: Yin, Xiangyu, et al.
Publicado: (2025)
por: Yin, Xiangyu, et al.
Publicado: (2025)
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
por: Yin, Xiangyu, et al.
Publicado: (2025)
por: Yin, Xiangyu, et al.
Publicado: (2025)
FragileFlow: Spectral Control of Correct-but-Fragile Predictions for Foundation Model Robustness
por: Li, Zhuoyun, et al.
Publicado: (2026)
por: Li, Zhuoyun, et al.
Publicado: (2026)
SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal Model
por: Huang, Zhenglin, et al.
Publicado: (2024)
por: Huang, Zhenglin, et al.
Publicado: (2024)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
por: Yi, Biao, et al.
Publicado: (2025)
por: Yi, Biao, et al.
Publicado: (2025)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
por: Huang, Xinmiao, et al.
Publicado: (2025)
por: Huang, Xinmiao, et al.
Publicado: (2025)
A Black-Box Evaluation Framework for Semantic Robustness in Bird's Eye View Detection
por: Wang, Fu, et al.
Publicado: (2024)
por: Wang, Fu, et al.
Publicado: (2024)
Responsible Agentic AI Requires Explicit Provenance
por: Hu, Jinwei, et al.
Publicado: (2026)
por: Hu, Jinwei, et al.
Publicado: (2026)
Achieving Sparse Activation in Small Language Models
por: Song, Jifeng, et al.
Publicado: (2024)
por: Song, Jifeng, et al.
Publicado: (2024)
Training Language Models to Generate Text with Citations via Fine-grained Rewards
por: Huang, Chengyu, et al.
Publicado: (2024)
por: Huang, Chengyu, et al.
Publicado: (2024)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
por: Cao, Yuanpu, et al.
Publicado: (2023)
por: Cao, Yuanpu, et al.
Publicado: (2023)
Fine-grained Stateful Knowledge Exploration: Effective and Efficient Graph Retrieval with Large Language Models
por: Tao, Dehao, et al.
Publicado: (2024)
por: Tao, Dehao, et al.
Publicado: (2024)
FLAT-LLM: Fine-grained Low-rank Activation Space Transformation for Large Language Model Compression
por: Tian, Jiayi, et al.
Publicado: (2025)
por: Tian, Jiayi, et al.
Publicado: (2025)
Delta -- Contrastive Decoding Mitigates Text Hallucinations in Large Language Models
por: Huang, Cheng Peng, et al.
Publicado: (2025)
por: Huang, Cheng Peng, et al.
Publicado: (2025)
How Contrastive Decoding Enhances Large Audio Language Models?
por: Lin, Tzu-Quan, et al.
Publicado: (2026)
por: Lin, Tzu-Quan, et al.
Publicado: (2026)
FTP: A Fine-grained Token-wise Pruner for Large Language Models via Token Routing
por: Li, Zekai, et al.
Publicado: (2024)
por: Li, Zekai, et al.
Publicado: (2024)
BlockPruner: Fine-grained Pruning for Large Language Models
por: Zhong, Longguang, et al.
Publicado: (2024)
por: Zhong, Longguang, et al.
Publicado: (2024)
PFME: A Modular Approach for Fine-grained Hallucination Detection and Editing of Large Language Models
por: Deng, Kunquan, et al.
Publicado: (2024)
por: Deng, Kunquan, et al.
Publicado: (2024)
Distilling Fine-grained Sentiment Understanding from Large Language Models
por: Zhang, Yice, et al.
Publicado: (2024)
por: Zhang, Yice, et al.
Publicado: (2024)
Fine-grained Gender Control in Machine Translation with Large Language Models
por: Lee, Minwoo, et al.
Publicado: (2024)
por: Lee, Minwoo, et al.
Publicado: (2024)
Large Language Model (LLM) AI text generation detection based on transformer deep learning algorithm
por: Mo, Yuhong, et al.
Publicado: (2024)
por: Mo, Yuhong, et al.
Publicado: (2024)
Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions
por: Zhang, Xiaoyun, et al.
Publicado: (2024)
por: Zhang, Xiaoyun, et al.
Publicado: (2024)
RefChecker: Reference-based Fine-grained Hallucination Checker and Benchmark for Large Language Models
por: Hu, Xiangkun, et al.
Publicado: (2024)
por: Hu, Xiangkun, et al.
Publicado: (2024)
From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models
por: Liu, Jinyi, et al.
Publicado: (2025)
por: Liu, Jinyi, et al.
Publicado: (2025)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
por: Huang, Tiansheng, et al.
Publicado: (2024)
por: Huang, Tiansheng, et al.
Publicado: (2024)
Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming
por: Liu, Jiaxu, et al.
Publicado: (2024)
por: Liu, Jiaxu, et al.
Publicado: (2024)
Strategy Adaptation in Large Language Model Werewolf Agents
por: Nakamori, Fuya, et al.
Publicado: (2025)
por: Nakamori, Fuya, et al.
Publicado: (2025)
Safety Analysis in the Era of Large Language Models: A Case Study of STPA using ChatGPT
por: Qi, Yi, et al.
Publicado: (2023)
por: Qi, Yi, et al.
Publicado: (2023)
Aligning Large Language Models via Fine-grained Supervision
por: Xu, Dehong, et al.
Publicado: (2024)
por: Xu, Dehong, et al.
Publicado: (2024)
Mutual Information-based Representations Disentanglement for Unaligned Multimodal Language Sequences
por: Qian, Fan, et al.
Publicado: (2024)
por: Qian, Fan, et al.
Publicado: (2024)
Large Language Models Have Intrinsic Meta-Cognition, but Need a Good Lens
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
por: Jiang, Chaoya, et al.
Publicado: (2024)
por: Jiang, Chaoya, et al.
Publicado: (2024)
Context-Aware Counterfactual Data Augmentation for Gender Bias Mitigation in Language Models
por: Parihar, Shweta, et al.
Publicado: (2026)
por: Parihar, Shweta, et al.
Publicado: (2026)
Smaller Large Language Models Can Do Moral Self-Correction
por: Liu, Guangliang, et al.
Publicado: (2024)
por: Liu, Guangliang, et al.
Publicado: (2024)
Covert Bias: The Severity of Social Views' Unalignment in Language Models Towards Implicit and Explicit Opinion
por: Aldayel, Abeer, et al.
Publicado: (2024)
por: Aldayel, Abeer, et al.
Publicado: (2024)
Fine-grained Hallucination Detection and Editing for Language Models
por: Mishra, Abhika, et al.
Publicado: (2024)
por: Mishra, Abhika, et al.
Publicado: (2024)
Ejemplares similares
-
Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models
por: Li, Zhuoyun, et al.
Publicado: (2026) -
Trust-Oriented Adaptive Guardrails for Large Language Models
por: Hu, Jinwei, et al.
Publicado: (2024) -
Building Guardrails for Large Language Models
por: Dong, Yi, et al.
Publicado: (2024) -
Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage
por: Hu, Jinwei, et al.
Publicado: (2026) -
CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models
por: Yin, Xiangyu, et al.
Publicado: (2025)