Making deep neural networks right for the right scientific reasons by interacting with their explanations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Schramowski, Patrick, Stammer, Wolfgang, Teso, Stefano, Brugger, Anna, Shao, Xiaoting, Luigs, Hans-Georg, Mahlein, Anne-Katrin, Kersting, Kristian |
|---|---|
| Format: | Preprint |
| Publié: |
2020
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Typology for Exploring the Mitigation of Shortcut Behavior
par: Friedrich, Felix, et autres
Publié: (2022)
par: Friedrich, Felix, et autres
Publié: (2022)
LIME: Making LLM Data More Efficient with Linguistic Metadata Embeddings
par: Sztwiertnia, Sebastian, et autres
Publié: (2025)
par: Sztwiertnia, Sebastian, et autres
Publié: (2025)
No right to an explanation
par: Brett Karlan, et autres
Publié: (2025)
par: Brett Karlan, et autres
Publié: (2025)
Neural Concept Binder
par: Stammer, Wolfgang, et autres
Publié: (2024)
par: Stammer, Wolfgang, et autres
Publié: (2024)
Object Centric Concept Bottlenecks
par: Steinmann, David, et autres
Publié: (2025)
par: Steinmann, David, et autres
Publié: (2025)
Learning to Intervene on Concept Bottlenecks
par: Steinmann, David, et autres
Publié: (2023)
par: Steinmann, David, et autres
Publié: (2023)
ActivationReasoning: Logical Reasoning in Latent Activation Spaces
par: Helff, Lukas, et autres
Publié: (2025)
par: Helff, Lukas, et autres
Publié: (2025)
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
par: Helff, Lukas, et autres
Publié: (2026)
par: Helff, Lukas, et autres
Publié: (2026)
Core Tokensets for Data-efficient Sequential Training of Transformers
par: Paul, Subarnaduti, et autres
Publié: (2024)
par: Paul, Subarnaduti, et autres
Publié: (2024)
SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems
par: Shindo, Hikaru, et autres
Publié: (2026)
par: Shindo, Hikaru, et autres
Publié: (2026)
T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings
par: Deiseroth, Björn, et autres
Publié: (2024)
par: Deiseroth, Björn, et autres
Publié: (2024)
LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models
par: Helff, Lukas, et autres
Publié: (2024)
par: Helff, Lukas, et autres
Publié: (2024)
Adaptive Rational Activations to Boost Deep Reinforcement Learning
par: Delfosse, Quentin, et autres
Publié: (2021)
par: Delfosse, Quentin, et autres
Publié: (2021)
No Safe Dose: How Training Data Drives Unsafe Image Generation
par: Friedrich, Felix, et autres
Publié: (2026)
par: Friedrich, Felix, et autres
Publié: (2026)
SLR: Automated Synthesis for Scalable Logical Reasoning
par: Helff, Lukas, et autres
Publié: (2025)
par: Helff, Lukas, et autres
Publié: (2025)
Interpretable Concept Bottlenecks to Align Reinforcement Learning Agents
par: Delfosse, Quentin, et autres
Publié: (2024)
par: Delfosse, Quentin, et autres
Publié: (2024)
Boosting Object Representation Learning via Motion and Object Continuity
par: Delfosse, Quentin, et autres
Publié: (2022)
par: Delfosse, Quentin, et autres
Publié: (2022)
Human-in-the-loop or AI-in-the-loop? Automate or Collaborate?
par: Natarajan, Sriraam, et autres
Publié: (2024)
par: Natarajan, Sriraam, et autres
Publié: (2024)
Beyond Overcorrection: Evaluating Diversity in T2I Models with DivBench
par: Friedrich, Felix, et autres
Publié: (2025)
par: Friedrich, Felix, et autres
Publié: (2025)
V-LoL: A Diagnostic Dataset for Visual Logical Learning
par: Helff, Lukas, et autres
Publié: (2023)
par: Helff, Lukas, et autres
Publié: (2023)
Pix2Code: Learning to Compose Neural Visual Concepts as Programs
par: Wüst, Antonia, et autres
Publié: (2024)
par: Wüst, Antonia, et autres
Publié: (2024)
Exploiting Cultural Biases via Homoglyphs in Text-to-Image Synthesis
par: Struppek, Lukas, et autres
Publié: (2022)
par: Struppek, Lukas, et autres
Publié: (2022)
AtMan: Understanding Transformer Predictions Through Memory Efficient Attention Manipulation
par: Deiseroth, Björn, et autres
Publié: (2023)
par: Deiseroth, Björn, et autres
Publié: (2023)
Does CLIP Know My Face?
par: Hintersdorf, Dominik, et autres
Publié: (2022)
par: Hintersdorf, Dominik, et autres
Publié: (2022)
SCAR: Sparse Conditioned Autoencoders for Concept Detection and Steering in LLMs
par: Härle, Ruben, et autres
Publié: (2024)
par: Härle, Ruben, et autres
Publié: (2024)
Bongard in Wonderland: Visual Puzzles that Still Make AI Go Mad?
par: Wüst, Antonia, et autres
Publié: (2024)
par: Wüst, Antonia, et autres
Publié: (2024)
Neural Concept Verifier: Scaling Prover-Verifier Games via Concept Encodings
par: Turan, Berkant, et autres
Publié: (2025)
par: Turan, Berkant, et autres
Publié: (2025)
Learning by Self-Explaining
par: Stammer, Wolfgang, et autres
Publié: (2023)
par: Stammer, Wolfgang, et autres
Publié: (2023)
DeiSAM: Segment Anything with Deictic Prompting
par: Shindo, Hikaru, et autres
Publié: (2024)
par: Shindo, Hikaru, et autres
Publié: (2024)
ART: Adaptive Relation Tuning for Generalized Relation Prediction
par: Sudhakaran, Gopika, et autres
Publié: (2025)
par: Sudhakaran, Gopika, et autres
Publié: (2025)
Synthesizing Visual Concepts as Vision-Language Programs
par: Wüst, Antonia, et autres
Publié: (2025)
par: Wüst, Antonia, et autres
Publié: (2025)
Where is the Truth? The Risk of Getting Confounded in a Continual World
par: Busch, Florian Peter, et autres
Publié: (2024)
par: Busch, Florian Peter, et autres
Publié: (2024)
How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions
par: Brack, Manuel, et autres
Publié: (2025)
par: Brack, Manuel, et autres
Publié: (2025)
Measuring and Guiding Monosemanticity
par: Härle, Ruben, et autres
Publié: (2025)
par: Härle, Ruben, et autres
Publié: (2025)
ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming
par: Tedeschi, Simone, et autres
Publié: (2024)
par: Tedeschi, Simone, et autres
Publié: (2024)
LEDITS++: Limitless Image Editing using Text-to-Image Models
par: Brack, Manuel, et autres
Publié: (2023)
par: Brack, Manuel, et autres
Publié: (2023)
Multilingual Text-to-Image Generation Magnifies Gender Stereotypes and Prompt Engineering May Not Help You
par: Friedrich, Felix, et autres
Publié: (2024)
par: Friedrich, Felix, et autres
Publié: (2024)
Divergent Token Metrics: Measuring degradation to prune away LLM components -- and optimize quantization
par: Deiseroth, Björn, et autres
Publié: (2023)
par: Deiseroth, Björn, et autres
Publié: (2023)
Adaptable Hindsight Experience Replay for Search-Based Learning
par: Vazaios, Alexandros, et autres
Publié: (2025)
par: Vazaios, Alexandros, et autres
Publié: (2025)
Aligned explanations in neural networks
par: Lobet, Corentin, et autres
Publié: (2026)
par: Lobet, Corentin, et autres
Publié: (2026)
Documents similaires
-
A Typology for Exploring the Mitigation of Shortcut Behavior
par: Friedrich, Felix, et autres
Publié: (2022) -
LIME: Making LLM Data More Efficient with Linguistic Metadata Embeddings
par: Sztwiertnia, Sebastian, et autres
Publié: (2025) -
No right to an explanation
par: Brett Karlan, et autres
Publié: (2025) -
Neural Concept Binder
par: Stammer, Wolfgang, et autres
Publié: (2024) -
Object Centric Concept Bottlenecks
par: Steinmann, David, et autres
Publié: (2025)