Adversarial Circuit Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | de Bos, Niels uit, Garriga-Alonso, Adrià |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Relating Piecewise Linear Kolmogorov Arnold Networks to ReLU Networks
di: Schoots, Nandi, et al.
Pubblicazione: (2025)
di: Schoots, Nandi, et al.
Pubblicazione: (2025)
SynthSAEBench: Evaluating Sparse Autoencoders on Scalable Realistic Synthetic Data
di: Chanin, David, et al.
Pubblicazione: (2026)
di: Chanin, David, et al.
Pubblicazione: (2026)
Investigating the Indirect Object Identification circuit in Mamba
di: Ensign, Danielle, et al.
Pubblicazione: (2024)
di: Ensign, Danielle, et al.
Pubblicazione: (2024)
Among Us: A Sandbox for Measuring and Detecting Agentic Deception
di: Golechha, Satvik, et al.
Pubblicazione: (2025)
di: Golechha, Satvik, et al.
Pubblicazione: (2025)
Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders
di: Chanin, David, et al.
Pubblicazione: (2025)
di: Chanin, David, et al.
Pubblicazione: (2025)
InterpBench: Semi-Synthetic Transformers for Evaluating Mechanistic Interpretability Techniques
di: Gupta, Rohan, et al.
Pubblicazione: (2024)
di: Gupta, Rohan, et al.
Pubblicazione: (2024)
Catastrophic Goodhart: regularizing RLHF with KL divergence does not mitigate heavy-tailed reward misspecification
di: Kwa, Thomas, et al.
Pubblicazione: (2024)
di: Kwa, Thomas, et al.
Pubblicazione: (2024)
Feature Hedging: Correlated Features Break Narrow Sparse Autoencoders
di: Chanin, David, et al.
Pubblicazione: (2025)
di: Chanin, David, et al.
Pubblicazione: (2025)
Hypothesis Testing the Circuit Hypothesis in LLMs
di: Shi, Claudia, et al.
Pubblicazione: (2024)
di: Shi, Claudia, et al.
Pubblicazione: (2024)
Biases in the Blind Spot: Detecting What LLMs Fail to Mention
di: Arcuschin, Iván, et al.
Pubblicazione: (2026)
di: Arcuschin, Iván, et al.
Pubblicazione: (2026)
Path Channels and Plan Extension Kernels: a Mechanistic Description of Planning in a Sokoban RNN
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2025)
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2025)
Interpreting Emergent Planning in Model-Free Reinforcement Learning
di: Bush, Thomas, et al.
Pubblicazione: (2025)
di: Bush, Thomas, et al.
Pubblicazione: (2025)
DiFR: Inference Verification Despite Nondeterminism
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
Analyzing the Generalization and Reliability of Steering Vectors
di: Tan, Daniel, et al.
Pubblicazione: (2024)
di: Tan, Daniel, et al.
Pubblicazione: (2024)
Planning in a recurrent neural network that plays Sokoban
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2024)
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2024)
Understanding and Improving Adversarial Robustness of Neural Probabilistic Circuits
di: Chen, Weixin, et al.
Pubblicazione: (2025)
di: Chen, Weixin, et al.
Pubblicazione: (2025)
CEPAE: Conditional Entropy-Penalized Autoencoders for Time Series Counterfactuals
di: Garriga, Tomàs, et al.
Pubblicazione: (2026)
di: Garriga, Tomàs, et al.
Pubblicazione: (2026)
Practical do-Shapley Explanations with Estimand-Agnostic Causal Inference
di: Parafita, Álvaro, et al.
Pubblicazione: (2025)
di: Parafita, Álvaro, et al.
Pubblicazione: (2025)
Variational Quantum Circuits Enhanced Generative Adversarial Network
di: Shu, Runqiu, et al.
Pubblicazione: (2024)
di: Shu, Runqiu, et al.
Pubblicazione: (2024)
Toward Evaluating Robustness of Reinforcement Learning with Adversarial Policy
di: Zheng, Xiang, et al.
Pubblicazione: (2023)
di: Zheng, Xiang, et al.
Pubblicazione: (2023)
Differentially Private and Adversarially Robust Machine Learning: An Empirical Evaluation
di: Thakkar, Janvi, et al.
Pubblicazione: (2024)
di: Thakkar, Janvi, et al.
Pubblicazione: (2024)
Decision-Aware Proximal Bridge Learning for Optimal Treatment Selection
di: Garriga, Tomàs, et al.
Pubblicazione: (2026)
di: Garriga, Tomàs, et al.
Pubblicazione: (2026)
Adversarial Graph Neural Network Benchmarks: Towards Practical and Fair Evaluation
di: Ngo, Tran Gia Bao, et al.
Pubblicazione: (2026)
di: Ngo, Tran Gia Bao, et al.
Pubblicazione: (2026)
Time-Efficient Evaluation and Enhancement of Adversarial Robustness in Deep Neural Networks
di: Lin, Runqi
Pubblicazione: (2025)
di: Lin, Runqi
Pubblicazione: (2025)
Personality Trait Inference Via Mobile Phone Sensors: A Machine Learning Approach
di: Sze, Wun Yung Shaney, et al.
Pubblicazione: (2024)
di: Sze, Wun Yung Shaney, et al.
Pubblicazione: (2024)
From Feature Visualization to Visual Circuits: Effect of Adversarial Model Manipulation
di: Nanfack, Geraldin, et al.
Pubblicazione: (2024)
di: Nanfack, Geraldin, et al.
Pubblicazione: (2024)
Forecasting Thermospheric Density with Transformers for Multi-Satellite Orbit Management
di: Bös, Cedric, et al.
Pubblicazione: (2025)
di: Bös, Cedric, et al.
Pubblicazione: (2025)
NanoFlux: Adversarial Dual-LLM Evaluation and Distillation For Multi-Domain Reasoning
di: Anantha, Raviteja, et al.
Pubblicazione: (2025)
di: Anantha, Raviteja, et al.
Pubblicazione: (2025)
Black-Box Adversarial Attacks on LLM-Based Code Completion
di: Jenko, Slobodan, et al.
Pubblicazione: (2024)
di: Jenko, Slobodan, et al.
Pubblicazione: (2024)
Evaluating Adversarial Attacks on Federated Learning for Temperature Forecasting
di: Chichifoi, Karina, et al.
Pubblicazione: (2025)
di: Chichifoi, Karina, et al.
Pubblicazione: (2025)
An Evaluation Study of Generative Adversarial Networks for Collaborative Filtering
di: Maurera, Fernando Benjamín Pérez, et al.
Pubblicazione: (2022)
di: Maurera, Fernando Benjamín Pérez, et al.
Pubblicazione: (2022)
Adversarial ML Problems Are Getting Harder to Solve and to Evaluate
di: Rando, Javier, et al.
Pubblicazione: (2025)
di: Rando, Javier, et al.
Pubblicazione: (2025)
AMSbench: A Comprehensive Benchmark for Evaluating MLLM Capabilities in AMS Circuits
di: Shi, Yichen, et al.
Pubblicazione: (2025)
di: Shi, Yichen, et al.
Pubblicazione: (2025)
Towards Trustworthy Wi-Fi CSI-based Sensing: Systematic Evaluation of Adversarial Robustness
di: Gopalakrishnan, Shreevanth Krishnaa, et al.
Pubblicazione: (2025)
di: Gopalakrishnan, Shreevanth Krishnaa, et al.
Pubblicazione: (2025)
Rethinking Encoder-Decoder Flow Through Shared Structures
di: Laboyrie, Frederik, et al.
Pubblicazione: (2025)
di: Laboyrie, Frederik, et al.
Pubblicazione: (2025)
Decoding Answers Before Chain-of-Thought: Evidence from Pre-CoT Probes and Activation Steering
di: Cox, Kyle, et al.
Pubblicazione: (2026)
di: Cox, Kyle, et al.
Pubblicazione: (2026)
Evaluating the Adversarial Robustness of Detection Transformers
di: Nazeri, Amirhossein, et al.
Pubblicazione: (2024)
di: Nazeri, Amirhossein, et al.
Pubblicazione: (2024)
Soft Learning Probabilistic Circuits
di: Ghandi, Soroush, et al.
Pubblicazione: (2024)
di: Ghandi, Soroush, et al.
Pubblicazione: (2024)
DR-CircuitGNN: Training Acceleration of Heterogeneous Circuit Graph Neural Network on GPUs
di: Luo, Yuebo, et al.
Pubblicazione: (2025)
di: Luo, Yuebo, et al.
Pubblicazione: (2025)
On the Impact of Hard Adversarial Instances on Overfitting in Adversarial Training
di: Liu, Chen, et al.
Pubblicazione: (2021)
di: Liu, Chen, et al.
Pubblicazione: (2021)
Documenti analoghi
-
Relating Piecewise Linear Kolmogorov Arnold Networks to ReLU Networks
di: Schoots, Nandi, et al.
Pubblicazione: (2025) -
SynthSAEBench: Evaluating Sparse Autoencoders on Scalable Realistic Synthetic Data
di: Chanin, David, et al.
Pubblicazione: (2026) -
Investigating the Indirect Object Identification circuit in Mamba
di: Ensign, Danielle, et al.
Pubblicazione: (2024) -
Among Us: A Sandbox for Measuring and Detecting Agentic Deception
di: Golechha, Satvik, et al.
Pubblicazione: (2025) -
Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders
di: Chanin, David, et al.
Pubblicazione: (2025)