AlignGuard-LoRA: Alignment-Preserving Fine-Tuning via Fisher-Guided Decomposition and Riemannian-Geodesic Collision Regularization
Fuente:
arXiv
Salvato in:
| Autori principali: | Das, Amitava, Borah, Abhilekh, Jain, Vinija, Chadha, Aman |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AlignMerge - Alignment-Preserving Large Language Model Merging via Fisher-Guided Geometric Constraints
di: Roy, Aniruddha, et al.
Pubblicazione: (2025)
di: Roy, Aniruddha, et al.
Pubblicazione: (2025)
TRACEALIGN -- Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs
di: Das, Amitava, et al.
Pubblicazione: (2025)
di: Das, Amitava, et al.
Pubblicazione: (2025)
ECLIPTICA -- A Framework for Switchable LLM Alignment via CITA - Contrastive Instruction-Tuned Alignment
di: Wanaskar, Kapil, et al.
Pubblicazione: (2026)
di: Wanaskar, Kapil, et al.
Pubblicazione: (2026)
D-STEER - Preference Alignment Techniques Learn to Behave, not to Believe -- Beneath the Surface, DPO as Steering Vector Perturbation in Activation Space
di: Raina, Samarth, et al.
Pubblicazione: (2025)
di: Raina, Samarth, et al.
Pubblicazione: (2025)
LLMsAgainstHate @ NLU of Devanagari Script Languages 2025: Hate Speech Detection and Target Identification in Devanagari Languages via Parameter Efficient Fine-Tuning of LLMs
di: Sidibomma, Rushendra, et al.
Pubblicazione: (2024)
di: Sidibomma, Rushendra, et al.
Pubblicazione: (2024)
SPINAL -- Scaling-law and Preference Integration in Neural Alignment Layers
di: Das, Arion, et al.
Pubblicazione: (2026)
di: Das, Arion, et al.
Pubblicazione: (2026)
AlignGuard: Scalable Safety Alignment for Text-to-Image Generation
di: Liu, Runtao, et al.
Pubblicazione: (2024)
di: Liu, Runtao, et al.
Pubblicazione: (2024)
LoRACode: LoRA Adapters for Code Embeddings
di: Chaturvedi, Saumya, et al.
Pubblicazione: (2025)
di: Chaturvedi, Saumya, et al.
Pubblicazione: (2025)
Learning in the Fisher Subspace: A Guided Initialization for LoRA Fine-Tuning
di: Feng, Zhi-Quan, et al.
Pubblicazione: (2026)
di: Feng, Zhi-Quan, et al.
Pubblicazione: (2026)
Neural FOXP2 -- Language Specific Neuron Steering for Targeted Language Improvement in LLMs
di: Saha, Anusa, et al.
Pubblicazione: (2026)
di: Saha, Anusa, et al.
Pubblicazione: (2026)
Riemannian Preconditioned LoRA for Fine-Tuning Foundation Models
di: Zhang, Fangzhao, et al.
Pubblicazione: (2024)
di: Zhang, Fangzhao, et al.
Pubblicazione: (2024)
Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
di: Sinha, Neelabh, et al.
Pubblicazione: (2024)
di: Sinha, Neelabh, et al.
Pubblicazione: (2024)
MAAT: Multi-phase Adapter-Aware Targeted Unlearning
di: Yagnik, Suryash, et al.
Pubblicazione: (2026)
di: Yagnik, Suryash, et al.
Pubblicazione: (2026)
MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models
di: Saha, Partha Pratim, et al.
Pubblicazione: (2026)
di: Saha, Partha Pratim, et al.
Pubblicazione: (2026)
Position: The Complexity of Perfect AI Alignment -- Formalizing the RLHF Trilemma
di: Sahoo, Subramanyam, et al.
Pubblicazione: (2025)
di: Sahoo, Subramanyam, et al.
Pubblicazione: (2025)
SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement
di: Sahoo, Subramanyam, et al.
Pubblicazione: (2026)
di: Sahoo, Subramanyam, et al.
Pubblicazione: (2026)
SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation
di: Rawal, Niyati, et al.
Pubblicazione: (2026)
di: Rawal, Niyati, et al.
Pubblicazione: (2026)
YINYANG-ALIGN: Benchmarking Contradictory Objectives and Proposing Multi-Objective Optimization based DPO for Text-to-Image Alignment
di: Das, Amitava, et al.
Pubblicazione: (2025)
di: Das, Amitava, et al.
Pubblicazione: (2025)
LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement
di: Bian, Jieming, et al.
Pubblicazione: (2024)
di: Bian, Jieming, et al.
Pubblicazione: (2024)
CE-LoRA: Computation-Efficient LoRA Fine-Tuning for Language Models
di: Chen, Guanduo, et al.
Pubblicazione: (2025)
di: Chen, Guanduo, et al.
Pubblicazione: (2025)
Parameter Efficient Fine Tuning: A Comprehensive Analysis Across Applications
di: Balne, Charith Chandra Sai, et al.
Pubblicazione: (2024)
di: Balne, Charith Chandra Sai, et al.
Pubblicazione: (2024)
Alignment Quality Index (AQI) : Beyond Refusals: AQI as an Intrinsic Alignment Diagnostic via Latent Geometry, Cluster Divergence, and Layer wise Pooled Representations
di: Borah, Abhilekh, et al.
Pubblicazione: (2025)
di: Borah, Abhilekh, et al.
Pubblicazione: (2025)
AMBEDKAR-A Multi-level Bias Elimination through a Decoding Approach with Knowledge Augmentation for Robust Constitutional Alignment of Language Models
di: Mukhopadhyay, Snehasis, et al.
Pubblicazione: (2025)
di: Mukhopadhyay, Snehasis, et al.
Pubblicazione: (2025)
Are Small Language Models Ready to Compete with Large Language Models for Practical Applications?
di: Sinha, Neelabh, et al.
Pubblicazione: (2024)
di: Sinha, Neelabh, et al.
Pubblicazione: (2024)
DR-LoRA: Dynamic Rank LoRA for Fine-Tuning Mixture-of-Experts Models
di: Deng, Guanzhi, et al.
Pubblicazione: (2026)
di: Deng, Guanzhi, et al.
Pubblicazione: (2026)
FedMomentum: Preserving LoRA Training Momentum in Federated Fine-Tuning
di: Yan, Peishen, et al.
Pubblicazione: (2026)
di: Yan, Peishen, et al.
Pubblicazione: (2026)
LoRA-Edit: Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-Tuning
di: Gao, Chenjian, et al.
Pubblicazione: (2025)
di: Gao, Chenjian, et al.
Pubblicazione: (2025)
Peccavi: Visual Paraphrase Attack Safe and Distortion Free Image Watermarking Technique for AI-Generated Images
di: Dixit, Shreyas, et al.
Pubblicazione: (2025)
di: Dixit, Shreyas, et al.
Pubblicazione: (2025)
PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training
di: Kumar, Harsh, et al.
Pubblicazione: (2026)
di: Kumar, Harsh, et al.
Pubblicazione: (2026)
MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning
di: Zheng, Xinhan, et al.
Pubblicazione: (2025)
di: Zheng, Xinhan, et al.
Pubblicazione: (2025)
HydraLoRA: An Asymmetric LoRA Architecture for Efficient Fine-Tuning
di: Tian, Chunlin, et al.
Pubblicazione: (2024)
di: Tian, Chunlin, et al.
Pubblicazione: (2024)
LoRAFusion: Efficient LoRA Fine-Tuning for LLMs
di: Zhu, Zhanda, et al.
Pubblicazione: (2025)
di: Zhu, Zhanda, et al.
Pubblicazione: (2025)
KD-LoRA: A Hybrid Approach to Efficient Fine-Tuning with LoRA and Knowledge Distillation
di: Azimi, Rambod, et al.
Pubblicazione: (2024)
di: Azimi, Rambod, et al.
Pubblicazione: (2024)
SC-LoRA: Balancing Efficient Fine-tuning and Knowledge Preservation via Subspace-Constrained LoRA
di: Luo, Minrui, et al.
Pubblicazione: (2025)
di: Luo, Minrui, et al.
Pubblicazione: (2025)
Rethinking the Rank Threshold for LoRA Fine-Tuning
di: Park, Juneyoung
Pubblicazione: (2026)
di: Park, Juneyoung
Pubblicazione: (2026)
SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference
di: Chauhan, Anay, et al.
Pubblicazione: (2026)
di: Chauhan, Anay, et al.
Pubblicazione: (2026)
LoRA-Edge: Tensor-Train-Assisted LoRA for Practical CNN Fine-Tuning on Edge Devices
di: Kwak, Hyunseok, et al.
Pubblicazione: (2025)
di: Kwak, Hyunseok, et al.
Pubblicazione: (2025)
On the Relationship between Sentence Analogy Identification and Sentence Structure Encoding in Large Language Models
di: Wijesiriwardene, Thilini, et al.
Pubblicazione: (2023)
di: Wijesiriwardene, Thilini, et al.
Pubblicazione: (2023)
The What, Why, and How of Context Length Extension Techniques in Large Language Models -- A Detailed Survey
di: Pawar, Saurav, et al.
Pubblicazione: (2024)
di: Pawar, Saurav, et al.
Pubblicazione: (2024)
Riemannian Optimization for LoRA on the Stiefel Manifold
di: Park, Juneyoung, et al.
Pubblicazione: (2025)
di: Park, Juneyoung, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AlignMerge - Alignment-Preserving Large Language Model Merging via Fisher-Guided Geometric Constraints
di: Roy, Aniruddha, et al.
Pubblicazione: (2025) -
TRACEALIGN -- Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs
di: Das, Amitava, et al.
Pubblicazione: (2025) -
ECLIPTICA -- A Framework for Switchable LLM Alignment via CITA - Contrastive Instruction-Tuned Alignment
di: Wanaskar, Kapil, et al.
Pubblicazione: (2026) -
D-STEER - Preference Alignment Techniques Learn to Behave, not to Believe -- Beneath the Surface, DPO as Steering Vector Perturbation in Activation Space
di: Raina, Samarth, et al.
Pubblicazione: (2025) -
LLMsAgainstHate @ NLU of Devanagari Script Languages 2025: Hate Speech Detection and Target Identification in Devanagari Languages via Parameter Efficient Fine-Tuning of LLMs
di: Sidibomma, Rushendra, et al.
Pubblicazione: (2024)