Visualizing Neural Network Imagination
Fuente:
arXiv
Salvato in:
| Autori principali: | Wichers, Nevan, Tao, Victor, Volpato, Riccardo, Barez, Fazl |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Understanding Addition in Transformers
di: Quirke, Philip, et al.
Pubblicazione: (2023)
di: Quirke, Philip, et al.
Pubblicazione: (2023)
SafetyNet: Detecting Harmful Outputs in LLMs by Modeling and Monitoring Deceptive Behaviors
di: Chaudhary, Maheep, et al.
Pubblicazione: (2025)
di: Chaudhary, Maheep, et al.
Pubblicazione: (2025)
Same Question, Different Words: A Latent Adversarial Framework for Prompt Robustness
di: Fu, Tingchen, et al.
Pubblicazione: (2025)
di: Fu, Tingchen, et al.
Pubblicazione: (2025)
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
di: Lan, Michael, et al.
Pubblicazione: (2023)
di: Lan, Michael, et al.
Pubblicazione: (2023)
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
di: Schrodi, Simon, et al.
Pubblicazione: (2025)
di: Schrodi, Simon, et al.
Pubblicazione: (2025)
Interpreting Context Look-ups in Transformers: Investigating Attention-MLP Interactions
di: Neo, Clement, et al.
Pubblicazione: (2024)
di: Neo, Clement, et al.
Pubblicazione: (2024)
Recontextualization Mitigates Specification Gaming without Modifying the Specification
di: Azarbal, Ariana, et al.
Pubblicazione: (2025)
di: Azarbal, Ariana, et al.
Pubblicazione: (2025)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
di: Oozeer, Narmeen, et al.
Pubblicazione: (2025)
di: Oozeer, Narmeen, et al.
Pubblicazione: (2025)
Scaling sparse feature circuit finding for in-context learning
di: Kharlapenko, Dmitrii, et al.
Pubblicazione: (2025)
di: Kharlapenko, Dmitrii, et al.
Pubblicazione: (2025)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
di: Lan, Michael, et al.
Pubblicazione: (2024)
di: Lan, Michael, et al.
Pubblicazione: (2024)
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
di: Kim, Minseon, et al.
Pubblicazione: (2025)
di: Kim, Minseon, et al.
Pubblicazione: (2025)
Enhancing Neural Network Interpretability with Feature-Aligned Sparse Autoencoders
di: Marks, Luke, et al.
Pubblicazione: (2024)
di: Marks, Luke, et al.
Pubblicazione: (2024)
Query Circuits: Explaining How Language Models Answer User Prompts
di: Wu, Tung-Yu, et al.
Pubblicazione: (2025)
di: Wu, Tung-Yu, et al.
Pubblicazione: (2025)
Model Spec Midtraining: Improving How Alignment Training Generalizes
di: Li, Chloe, et al.
Pubblicazione: (2026)
di: Li, Chloe, et al.
Pubblicazione: (2026)
Best-of-N Jailbreaking
di: Hughes, John, et al.
Pubblicazione: (2024)
di: Hughes, John, et al.
Pubblicazione: (2024)
Rethinking AI Cultural Alignment
di: Bravansky, Michal, et al.
Pubblicazione: (2025)
di: Bravansky, Michal, et al.
Pubblicazione: (2025)
Large Language Models Relearn Removed Concepts
di: Lo, Michelle, et al.
Pubblicazione: (2024)
di: Lo, Michelle, et al.
Pubblicazione: (2024)
Imagined Autocurricula
di: Güzel, Ahmet H., et al.
Pubblicazione: (2025)
di: Güzel, Ahmet H., et al.
Pubblicazione: (2025)
The GECo algorithm for Graph Neural Networks Explanation
di: Calderaro, Salvatore, et al.
Pubblicazione: (2024)
di: Calderaro, Salvatore, et al.
Pubblicazione: (2024)
Metric Learning for Clifford Group Equivariant Neural Networks
di: Ali, Riccardo, et al.
Pubblicazione: (2024)
di: Ali, Riccardo, et al.
Pubblicazione: (2024)
Understanding Addition and Subtraction in Transformers
di: Quirke, Philip, et al.
Pubblicazione: (2024)
di: Quirke, Philip, et al.
Pubblicazione: (2024)
Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach
di: Wang, Tony T., et al.
Pubblicazione: (2024)
di: Wang, Tony T., et al.
Pubblicazione: (2024)
VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models
di: Gupta, Aman, et al.
Pubblicazione: (2025)
di: Gupta, Aman, et al.
Pubblicazione: (2025)
Tensor-view Topological Graph Neural Network
di: Wen, Tao, et al.
Pubblicazione: (2024)
di: Wen, Tao, et al.
Pubblicazione: (2024)
Choreographer: Learning and Adapting Skills in Imagination
di: Mazzaglia, Pietro, et al.
Pubblicazione: (2022)
di: Mazzaglia, Pietro, et al.
Pubblicazione: (2022)
APEX: Probing Neural Networks via Activation Perturbation
di: Ren, Tao, et al.
Pubblicazione: (2026)
di: Ren, Tao, et al.
Pubblicazione: (2026)
Interpretable Neural System Dynamics: Combining Deep Learning with System Dynamics Modeling to Support Critical Applications
di: D'Elia, Riccardo
Pubblicazione: (2025)
di: D'Elia, Riccardo
Pubblicazione: (2025)
Creative Agents: Empowering Agents with Imagination for Creative Tasks
di: Cai, Penglin, et al.
Pubblicazione: (2023)
di: Cai, Penglin, et al.
Pubblicazione: (2023)
Imagination-Limited Q-Learning for Offline Reinforcement Learning
di: Liu, Wenhui, et al.
Pubblicazione: (2025)
di: Liu, Wenhui, et al.
Pubblicazione: (2025)
DeepImagine: Learning Biomedical Reasoning via Successive Counterfactual Imagining
di: Zheng, Youze, et al.
Pubblicazione: (2026)
di: Zheng, Youze, et al.
Pubblicazione: (2026)
Do Sparse Autoencoders Generalize? A Case Study of Answerability
di: Heindrich, Lovis, et al.
Pubblicazione: (2025)
di: Heindrich, Lovis, et al.
Pubblicazione: (2025)
Algebraic Priors for Approximately Equivariant Networks
di: Ali, Riccardo, et al.
Pubblicazione: (2025)
di: Ali, Riccardo, et al.
Pubblicazione: (2025)
Self-Imagine: Effective Unimodal Reasoning with Multimodal Models using Self-Imagination
di: Akter, Syeda Nahida, et al.
Pubblicazione: (2024)
di: Akter, Syeda Nahida, et al.
Pubblicazione: (2024)
Magnitude-Modulated Equivariant Adapter for Parameter-Efficient Fine-Tuning of Equivariant Graph Neural Networks
di: Jin, Dian, et al.
Pubblicazione: (2025)
di: Jin, Dian, et al.
Pubblicazione: (2025)
DMWM: Dual-Mind World Model with Long-Term Imagination
di: Wang, Lingyi, et al.
Pubblicazione: (2025)
di: Wang, Lingyi, et al.
Pubblicazione: (2025)
WATS: Calibrating Graph Neural Networks with Wavelet-Aware Temperature Scaling
di: Li, Xiaoyang, et al.
Pubblicazione: (2025)
di: Li, Xiaoyang, et al.
Pubblicazione: (2025)
Reaching Consensus in Cooperative Multi-Agent Reinforcement Learning with Goal Imagination
di: Wang, Liangzhou, et al.
Pubblicazione: (2024)
di: Wang, Liangzhou, et al.
Pubblicazione: (2024)
MAGIK: Mapping to Analogous Goals via Imagination-enabled Knowledge Transfer
di: Palattuparambil, Ajsal Shereef, et al.
Pubblicazione: (2025)
di: Palattuparambil, Ajsal Shereef, et al.
Pubblicazione: (2025)
DFA-GNN: Forward Learning of Graph Neural Networks by Direct Feedback Alignment
di: Zhao, Gongpei, et al.
Pubblicazione: (2024)
di: Zhao, Gongpei, et al.
Pubblicazione: (2024)
Graph Neural Networks for Learning Equivariant Representations of Neural Networks
di: Kofinas, Miltiadis, et al.
Pubblicazione: (2024)
di: Kofinas, Miltiadis, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Understanding Addition in Transformers
di: Quirke, Philip, et al.
Pubblicazione: (2023) -
SafetyNet: Detecting Harmful Outputs in LLMs by Modeling and Monitoring Deceptive Behaviors
di: Chaudhary, Maheep, et al.
Pubblicazione: (2025) -
Same Question, Different Words: A Latent Adversarial Framework for Prompt Robustness
di: Fu, Tingchen, et al.
Pubblicazione: (2025) -
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
di: Lan, Michael, et al.
Pubblicazione: (2023) -
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
di: Schrodi, Simon, et al.
Pubblicazione: (2025)