Large Language Models as Attribution Regularizers for Efficient Model Training
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Vukadin, Davor, Šilić, Marin, Delač, Goran |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Advancing Attribution-Based Neural Network Explainability through Relative Absolute Magnitude Layer-Wise Relevance Propagation and Multi-Component Evaluation
von: Vukadin, Davor, et al.
Veröffentlicht: (2024)
von: Vukadin, Davor, et al.
Veröffentlicht: (2024)
Spectral Compact Training: Pre-Training Large Language Models via Permanent Truncated SVD and Stiefel QR Retraction
von: Kohlberger, Björn Roman
Veröffentlicht: (2026)
von: Kohlberger, Björn Roman
Veröffentlicht: (2026)
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
von: Fadli, Samih
Veröffentlicht: (2025)
von: Fadli, Samih
Veröffentlicht: (2025)
The Geometry of Thought: How Scale Restructures Reasoning In Large Language Models
von: Anderson, Samuel Cyrenius
Veröffentlicht: (2026)
von: Anderson, Samuel Cyrenius
Veröffentlicht: (2026)
Reasoning Large Language Model Errors Arise from Hallucinating Critical Problem Features
von: Heyman, Alex, et al.
Veröffentlicht: (2025)
von: Heyman, Alex, et al.
Veröffentlicht: (2025)
Approximate Domain Unlearning for Vision-Language Models
von: Kawamura, Kodai, et al.
Veröffentlicht: (2025)
von: Kawamura, Kodai, et al.
Veröffentlicht: (2025)
Deep Memory Search: A Metaheuristic Approach for Optimizing Heuristic Search
von: Hedar, Abdel-Rahman, et al.
Veröffentlicht: (2024)
von: Hedar, Abdel-Rahman, et al.
Veröffentlicht: (2024)
Scaling Offline RL via Efficient and Expressive Shortcut Models
von: Espinosa-Dice, Nicolas, et al.
Veröffentlicht: (2025)
von: Espinosa-Dice, Nicolas, et al.
Veröffentlicht: (2025)
Architectural Proprioception in State Space Models: Thermodynamic Training Induces Anticipatory Halt Detection
von: Noon, Jay
Veröffentlicht: (2026)
von: Noon, Jay
Veröffentlicht: (2026)
The Anti-Ouroboros Effect: Emergent Resilience in Large Language Models from Recursive Selective Feedback
von: Adapala, Sai Teja Reddy
Veröffentlicht: (2025)
von: Adapala, Sai Teja Reddy
Veröffentlicht: (2025)
Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models
von: Cui, Sasha, et al.
Veröffentlicht: (2025)
von: Cui, Sasha, et al.
Veröffentlicht: (2025)
Relevance-driven Input Dropout: an Explanation-guided Regularization Technique
von: Gururaj, Shreyas, et al.
Veröffentlicht: (2025)
von: Gururaj, Shreyas, et al.
Veröffentlicht: (2025)
Training Artificial Neural Networks by Coordinate Search Algorithm
von: Rokhsatyazdi, Ehsan, et al.
Veröffentlicht: (2024)
von: Rokhsatyazdi, Ehsan, et al.
Veröffentlicht: (2024)
Unlearning at Scale: Implementing the Right to be Forgotten in Large Language Models
von: X, Abdullah
Veröffentlicht: (2025)
von: X, Abdullah
Veröffentlicht: (2025)
Evaluating Model Explanations without Ground Truth
von: Rawal, Kaivalya, et al.
Veröffentlicht: (2025)
von: Rawal, Kaivalya, et al.
Veröffentlicht: (2025)
Grokking Beyond the Euclidean Norm of Model Parameters
von: Notsawo, Pascal Jr Tikeng, et al.
Veröffentlicht: (2025)
von: Notsawo, Pascal Jr Tikeng, et al.
Veröffentlicht: (2025)
Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models
von: Zhang, Gongbo, et al.
Veröffentlicht: (2026)
von: Zhang, Gongbo, et al.
Veröffentlicht: (2026)
Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning
von: Adapala, Sai Teja Reddy
Veröffentlicht: (2025)
von: Adapala, Sai Teja Reddy
Veröffentlicht: (2025)
Black Box Model Explanations and the Human Interpretability Expectations -- An Analysis in the Context of Homicide Prediction
von: Ribeiro, José, et al.
Veröffentlicht: (2022)
von: Ribeiro, José, et al.
Veröffentlicht: (2022)
A Practical Approach to using Supervised Machine Learning Models to Classify Aviation Safety Occurrences
von: Siow, Bryan Y.
Veröffentlicht: (2025)
von: Siow, Bryan Y.
Veröffentlicht: (2025)
Model Fusion via Retrofitting
von: Luenam, Phoomraphee, et al.
Veröffentlicht: (2025)
von: Luenam, Phoomraphee, et al.
Veröffentlicht: (2025)
A Framework for Neurosymbolic Robot Action Planning using Large Language Models
von: Capitanelli, Alessio, et al.
Veröffentlicht: (2023)
von: Capitanelli, Alessio, et al.
Veröffentlicht: (2023)
Beyond Hallucinations: A Composite Score for Measuring Reliability in Open-Source Large Language Models
von: Salla, Rohit Kumar, et al.
Veröffentlicht: (2025)
von: Salla, Rohit Kumar, et al.
Veröffentlicht: (2025)
Multi-Task Reinforcement Learning with Language-Encoded Gated Policy Networks
von: Arora, Rushiv
Veröffentlicht: (2025)
von: Arora, Rushiv
Veröffentlicht: (2025)
AGWM: Affordance-Grounded World Models for Environments with Compositional Prerequisites
von: Zhang, Qinshi, et al.
Veröffentlicht: (2026)
von: Zhang, Qinshi, et al.
Veröffentlicht: (2026)
How Does Unfaithful Reasoning Emerge from Autoregressive Training? A Study of Synthetic Experiments
von: Wang, Fuxin, et al.
Veröffentlicht: (2026)
von: Wang, Fuxin, et al.
Veröffentlicht: (2026)
Towards Understanding Sycophancy in Language Models
von: Sharma, Mrinank, et al.
Veröffentlicht: (2023)
von: Sharma, Mrinank, et al.
Veröffentlicht: (2023)
On Semantic Loss Fine-Tuning Approach for Preventing Model Collapse in Causal Reasoning
von: Deshmukh, Pratik, et al.
Veröffentlicht: (2026)
von: Deshmukh, Pratik, et al.
Veröffentlicht: (2026)
CORE: Towards Scalable and Efficient Causal Discovery with Reinforcement Learning
von: Sauter, Andreas W. M., et al.
Veröffentlicht: (2024)
von: Sauter, Andreas W. M., et al.
Veröffentlicht: (2024)
HEHRGNN: A Unified Embedding Model for Knowledge Graphs with Hyperedges and Hyper-Relational Edges
von: Rajagopalamenon, Rajesh, et al.
Veröffentlicht: (2026)
von: Rajagopalamenon, Rajesh, et al.
Veröffentlicht: (2026)
Quantization Undoes Alignment: Bias Emergence in Compressed LLMs Across Models and Precision Levels
von: Rath, Plawan Kumar, et al.
Veröffentlicht: (2026)
von: Rath, Plawan Kumar, et al.
Veröffentlicht: (2026)
Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models
von: Steele, Brady, et al.
Veröffentlicht: (2026)
von: Steele, Brady, et al.
Veröffentlicht: (2026)
What Do World Models Learn in RL? Probing Latent Representations in Learned Environment Simulators
von: Zhang, Xinyu
Veröffentlicht: (2026)
von: Zhang, Xinyu
Veröffentlicht: (2026)
Combining Trained Models in Reinforcement Learning
von: Patil, Ujjwal, et al.
Veröffentlicht: (2026)
von: Patil, Ujjwal, et al.
Veröffentlicht: (2026)
FastForward Pruning: Efficient LLM Pruning via Single-Step Reinforcement Learning
von: Yuan, Xin, et al.
Veröffentlicht: (2025)
von: Yuan, Xin, et al.
Veröffentlicht: (2025)
Ground-Compose-Reinforce: Grounding Language in Agentic Behaviours using Limited Data
von: Li, Andrew C., et al.
Veröffentlicht: (2025)
von: Li, Andrew C., et al.
Veröffentlicht: (2025)
Adaptive Activation Cancellation for Hallucination Mitigation in Large Language Models
von: Yocam, Eric, et al.
Veröffentlicht: (2026)
von: Yocam, Eric, et al.
Veröffentlicht: (2026)
Alif: Advancing Urdu Large Language Models via Multilingual Synthetic Data Distillation
von: Shafique, Muhammad Ali, et al.
Veröffentlicht: (2025)
von: Shafique, Muhammad Ali, et al.
Veröffentlicht: (2025)
Prototype Transformer: Towards Language Model Architectures Interpretable by Design
von: Yordanov, Yordan, et al.
Veröffentlicht: (2026)
von: Yordanov, Yordan, et al.
Veröffentlicht: (2026)
Domain-Specific Pretraining of Language Models: A Comparative Study in the Medical Field
von: Kerner, Tobias
Veröffentlicht: (2024)
von: Kerner, Tobias
Veröffentlicht: (2024)
Ähnliche Einträge
-
Advancing Attribution-Based Neural Network Explainability through Relative Absolute Magnitude Layer-Wise Relevance Propagation and Multi-Component Evaluation
von: Vukadin, Davor, et al.
Veröffentlicht: (2024) -
Spectral Compact Training: Pre-Training Large Language Models via Permanent Truncated SVD and Stiefel QR Retraction
von: Kohlberger, Björn Roman
Veröffentlicht: (2026) -
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
von: Fadli, Samih
Veröffentlicht: (2025) -
The Geometry of Thought: How Scale Restructures Reasoning In Large Language Models
von: Anderson, Samuel Cyrenius
Veröffentlicht: (2026) -
Reasoning Large Language Model Errors Arise from Hallucinating Critical Problem Features
von: Heyman, Alex, et al.
Veröffentlicht: (2025)