Gradient Atoms: Unsupervised Discovery, Attribution and Steering of Model Behaviors via Sparse Decomposition of Training Gradients
Fuente:
arXiv
Salvato in:
| Autore principale: | Rosser, J |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Infusion: Shaping Model Behavior by Editing Training Data via Influence Functions
di: Rosser, J, et al.
Pubblicazione: (2026)
di: Rosser, J, et al.
Pubblicazione: (2026)
AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement
di: Rosser, J, et al.
Pubblicazione: (2025)
di: Rosser, J, et al.
Pubblicazione: (2025)
Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward
di: Xu, Renjun, et al.
Pubblicazione: (2026)
di: Xu, Renjun, et al.
Pubblicazione: (2026)
Stream: Scaling up Mechanistic Interpretability to Long Context in LLMs via Sparse Attention
di: Rosser, J, et al.
Pubblicazione: (2025)
di: Rosser, J, et al.
Pubblicazione: (2025)
Performance Evaluation of Sentiment Analysis on Text and Emoji Data Using End-to-End, Transfer Learning, Distributed and Explainable AI Models
di: Velampalli, Sirisha, et al.
Pubblicazione: (2025)
di: Velampalli, Sirisha, et al.
Pubblicazione: (2025)
ART: Adaptive Response Tuning Framework -- A Multi-Agent Tournament-Based Approach to LLM Response Optimization
di: Khan, Omer Jauhar
Pubblicazione: (2025)
di: Khan, Omer Jauhar
Pubblicazione: (2025)
Improving Generalization in Heterogeneous Federated Continual Learning via Spatio-Temporal Gradient Matching with Prototypical Coreset
di: Nguyen, Minh-Duong, et al.
Pubblicazione: (2025)
di: Nguyen, Minh-Duong, et al.
Pubblicazione: (2025)
NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles
di: Jia, Xiao
Pubblicazione: (2026)
di: Jia, Xiao
Pubblicazione: (2026)
Manipulating Transformer-Based Models: Controllability, Steerability, and Robust Interventions
di: Alpay, Faruk, et al.
Pubblicazione: (2025)
di: Alpay, Faruk, et al.
Pubblicazione: (2025)
TPI-LLM: Serving 70B-scale LLMs Efficiently on Low-resource Edge Devices
di: Li, Zonghang, et al.
Pubblicazione: (2024)
di: Li, Zonghang, et al.
Pubblicazione: (2024)
Improving Local Training in Federated Learning via Temperature Scaling
di: Lee, Kichang, et al.
Pubblicazione: (2024)
di: Lee, Kichang, et al.
Pubblicazione: (2024)
Prima.cpp: Fast 30-70B LLM Inference on Heterogeneous and Low-Resource Home Clusters
di: Li, Zonghang, et al.
Pubblicazione: (2025)
di: Li, Zonghang, et al.
Pubblicazione: (2025)
Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design
di: Pepe, Alberto, et al.
Pubblicazione: (2026)
di: Pepe, Alberto, et al.
Pubblicazione: (2026)
Serial Parallel Reliability Redundancy Allocation Optimization for Energy Efficient and Fault Tolerant Cloud Computing
di: Krishna, Gutha Jaya
Pubblicazione: (2024)
di: Krishna, Gutha Jaya
Pubblicazione: (2024)
MDIA: A Multi-Agent Diagnostic Intelligence Pipeline on HealthBench Professional
di: Cruz, Roberto, et al.
Pubblicazione: (2026)
di: Cruz, Roberto, et al.
Pubblicazione: (2026)
Adaptive Multi-Stage Patent Claim Generation with Unified Quality Assessment
di: Liang, Chen-Wei, et al.
Pubblicazione: (2026)
di: Liang, Chen-Wei, et al.
Pubblicazione: (2026)
HumanMCP: A Human-Like Query Dataset for Evaluating MCP Tool Retrieval Performance
di: Laddha, Shubh, et al.
Pubblicazione: (2025)
di: Laddha, Shubh, et al.
Pubblicazione: (2025)
Evolutionary Algorithms Approach For Search Based On Semantic Document Similarity
di: Muniyappa, Chandrashekar, et al.
Pubblicazione: (2025)
di: Muniyappa, Chandrashekar, et al.
Pubblicazione: (2025)
Enhancing Mathematical Problem Solving in LLMs through Execution-Driven Reasoning Augmentation
di: Basarkar, Aditya, et al.
Pubblicazione: (2026)
di: Basarkar, Aditya, et al.
Pubblicazione: (2026)
Bio AI Agent: A Multi-Agent Artificial Intelligence System for Autonomous CAR-T Cell Therapy Development with Integrated Target Discovery, Toxicity Prediction, and Rational Molecular Design
di: Ni, Yi, et al.
Pubblicazione: (2025)
di: Ni, Yi, et al.
Pubblicazione: (2025)
Robust and Diverse Multi-Agent Learning via Rational Policy Gradient
di: Lauffer, Niklas, et al.
Pubblicazione: (2025)
di: Lauffer, Niklas, et al.
Pubblicazione: (2025)
Go Big or Go Home: Simulating Mobbing Behavior with Braitenbergian Robots
di: Sanoubari, Elaheh
Pubblicazione: (2026)
di: Sanoubari, Elaheh
Pubblicazione: (2026)
Controlling Long-Horizon Behavior in Language Model Agents with Explicit State Dynamics
di: Subaharan, Sukesh
Pubblicazione: (2026)
di: Subaharan, Sukesh
Pubblicazione: (2026)
DeTrigger: A Gradient-Centric Approach to Backdoor Attack Mitigation in Federated Learning
di: Lee, Kichang, et al.
Pubblicazione: (2024)
di: Lee, Kichang, et al.
Pubblicazione: (2024)
Dynamic Dual-Granularity Skill Bank for Agentic RL
di: Tu, Songjun, et al.
Pubblicazione: (2026)
di: Tu, Songjun, et al.
Pubblicazione: (2026)
A Multi-Agent Framework for Medical AI: Leveraging Fine-Tuned GPT, LLaMA, and DeepSeek R1 for Evidence-Based and Bias-Aware Clinical Query Processing
di: Nourmohammadi, Naeimeh, et al.
Pubblicazione: (2026)
di: Nourmohammadi, Naeimeh, et al.
Pubblicazione: (2026)
ARISE: Agentic Rubric-Guided Iterative Survey Engine for Automated Scholarly Paper Generation
di: Wang, Zi, et al.
Pubblicazione: (2025)
di: Wang, Zi, et al.
Pubblicazione: (2025)
Dynamical Priors as a Training Objective in Reinforcement Learning
di: Subaharan, Sukesh
Pubblicazione: (2026)
di: Subaharan, Sukesh
Pubblicazione: (2026)
Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks
di: Merves, Tyler H., et al.
Pubblicazione: (2026)
di: Merves, Tyler H., et al.
Pubblicazione: (2026)
Energy-Efficient and Real-Time Sensing for Federated Continual Learning via Sample-Driven Control
di: Luu, Minh Ngoc, et al.
Pubblicazione: (2023)
di: Luu, Minh Ngoc, et al.
Pubblicazione: (2023)
Understanding Endogenous Data Drift in Adaptive Models with Recourse-Seeking Users
di: Liu, Bo-Yi, et al.
Pubblicazione: (2025)
di: Liu, Bo-Yi, et al.
Pubblicazione: (2025)
Exploring Robust Multi-Agent Workflows for Environmental Data Management
di: Guan, Boyuan, et al.
Pubblicazione: (2026)
di: Guan, Boyuan, et al.
Pubblicazione: (2026)
Multi-Agent Synergy-Driven Iterative Visual Narrative Synthesis
di: Xi, Wang, et al.
Pubblicazione: (2025)
di: Xi, Wang, et al.
Pubblicazione: (2025)
The Provenance Paradox in Multi-Agent LLM Routing: Delegation Contracts and Attested Identity in LDP
di: Prakash, Sunil
Pubblicazione: (2026)
di: Prakash, Sunil
Pubblicazione: (2026)
LSTM-MAS: A Long Short-Term Memory Inspired Multi-Agent System for Long-Context Understanding
di: Jiang, Yichen, et al.
Pubblicazione: (2026)
di: Jiang, Yichen, et al.
Pubblicazione: (2026)
A survey of multi-agent geosimulation methodologies: from ABM to LLM
di: Padilla, Virginia, et al.
Pubblicazione: (2025)
di: Padilla, Virginia, et al.
Pubblicazione: (2025)
Tazza: Shuffling Neural Network Parameters for Secure and Private Federated Learning
di: Lee, Kichang, et al.
Pubblicazione: (2024)
di: Lee, Kichang, et al.
Pubblicazione: (2024)
AI Agents: Evolution, Architecture, and Real-World Applications
di: Krishnan, Naveen
Pubblicazione: (2025)
di: Krishnan, Naveen
Pubblicazione: (2025)
Adaptive Minds: Empowering Agents with LoRA-as-Tools
di: Shekar, Pavan C, et al.
Pubblicazione: (2025)
di: Shekar, Pavan C, et al.
Pubblicazione: (2025)
SocialX: A Modular Platform for Multi-Source Big Data Research in Indonesia
di: Saputra, Muhammad Apriandito Arya, et al.
Pubblicazione: (2026)
di: Saputra, Muhammad Apriandito Arya, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Infusion: Shaping Model Behavior by Editing Training Data via Influence Functions
di: Rosser, J, et al.
Pubblicazione: (2026) -
AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement
di: Rosser, J, et al.
Pubblicazione: (2025) -
Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward
di: Xu, Renjun, et al.
Pubblicazione: (2026) -
Stream: Scaling up Mechanistic Interpretability to Long Context in LLMs via Sparse Attention
di: Rosser, J, et al.
Pubblicazione: (2025) -
Performance Evaluation of Sentiment Analysis on Text and Emoji Data Using End-to-End, Transfer Learning, Distributed and Explainable AI Models
di: Velampalli, Sirisha, et al.
Pubblicazione: (2025)