All Roads Lead to Rome? Exploring Representational Similarities Between Latent Spaces of Generative Image Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Badrinath, Charumathi, Bhalla, Usha, Oesterling, Alex, Srinivas, Suraj, Lakkaraju, Himabindu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Interpreting CLIP with Sparse Linear Concept Embeddings (SpLiCE)
par: Bhalla, Usha, et autres
Publié: (2024)
par: Bhalla, Usha, et autres
Publié: (2024)
Discriminative Feature Attributions: Bridging Post Hoc Explainability and Inherent Interpretability
par: Bhalla, Usha, et autres
Publié: (2023)
par: Bhalla, Usha, et autres
Publié: (2023)
Operationalizing the Blueprint for an AI Bill of Rights: Recommendations for Practitioners, Researchers, and Policy Makers
par: Oesterling, Alex, et autres
Publié: (2024)
par: Oesterling, Alex, et autres
Publié: (2024)
Towards Unifying Interpretability and Control: Evaluation via Intervention
par: Bhalla, Usha, et autres
Publié: (2024)
par: Bhalla, Usha, et autres
Publié: (2024)
Evaluating Adversarial Robustness of Concept Representations in Sparse Autoencoders
par: Li, Aaron J., et autres
Publié: (2025)
par: Li, Aaron J., et autres
Publié: (2025)
Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability
par: Bhalla, Usha, et autres
Publié: (2025)
par: Bhalla, Usha, et autres
Publié: (2025)
Characterizing Data Point Vulnerability via Average-Case Robustness
par: Han, Tessa, et autres
Publié: (2023)
par: Han, Tessa, et autres
Publié: (2023)
Towards Unified Attribution in Explainable AI, Data-Centric AI, and Mechanistic Interpretability
par: Zhang, Shichang, et autres
Publié: (2025)
par: Zhang, Shichang, et autres
Publié: (2025)
Generalized Group Data Attribution
par: Ley, Dan, et autres
Publié: (2024)
par: Ley, Dan, et autres
Publié: (2024)
Who's the (Multi-)Fairest of Them All: Rethinking Interpolation-Based Data Augmentation Through the Lens of Multicalibration
par: Halevy, Karina, et autres
Publié: (2024)
par: Halevy, Karina, et autres
Publié: (2024)
Inference-Time Reward Hacking in Large Language Models
par: Khalaf, Hadi, et autres
Publié: (2025)
par: Khalaf, Hadi, et autres
Publié: (2025)
Which Models have Perceptually-Aligned Gradients? An Explanation via Off-Manifold Robustness
par: Srinivas, Suraj, et autres
Publié: (2023)
par: Srinivas, Suraj, et autres
Publié: (2023)
Towards Interpretable Soft Prompts
par: Patel, Oam, et autres
Publié: (2025)
par: Patel, Oam, et autres
Publié: (2025)
Fair Machine Unlearning: Data Removal while Mitigating Disparities
par: Oesterling, Alex, et autres
Publié: (2023)
par: Oesterling, Alex, et autres
Publié: (2023)
Learning Recourse Costs from Pairwise Feature Comparisons
par: Rawal, Kaivalya, et autres
Publié: (2024)
par: Rawal, Kaivalya, et autres
Publié: (2024)
Certifying LLM Safety against Adversarial Prompting
par: Kumar, Aounon, et autres
Publié: (2023)
par: Kumar, Aounon, et autres
Publié: (2023)
Explaining the Model, Protecting Your Data: Revealing and Mitigating the Data Privacy Risks of Post-Hoc Model Explanations via Membership Inference
par: Huang, Catherine, et autres
Publié: (2024)
par: Huang, Catherine, et autres
Publié: (2024)
On the Trade-offs between Adversarial Robustness and Actionable Explanations
par: Krishna, Satyapriya, et autres
Publié: (2023)
par: Krishna, Satyapriya, et autres
Publié: (2023)
In-Context Unlearning: Language Models as Few Shot Unlearners
par: Pawelczyk, Martin, et autres
Publié: (2023)
par: Pawelczyk, Martin, et autres
Publié: (2023)
Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning
par: Xiong, Zidi, et autres
Publié: (2026)
par: Xiong, Zidi, et autres
Publié: (2026)
Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models
par: Pawelczyk, Martin, et autres
Publié: (2024)
par: Pawelczyk, Martin, et autres
Publié: (2024)
Soft Best-of-n Sampling for Model Alignment
par: Verdun, Claudio Mayrink, et autres
Publié: (2025)
par: Verdun, Claudio Mayrink, et autres
Publié: (2025)
Confronting LLMs with Traditional ML: Rethinking the Fairness of Large Language Models in Tabular Classifications
par: Liu, Yanchen, et autres
Publié: (2023)
par: Liu, Yanchen, et autres
Publié: (2023)
Exploring Representation-Aligned Latent Space for Better Generation
par: Xu, Wanghan, et autres
Publié: (2025)
par: Xu, Wanghan, et autres
Publié: (2025)
Alternatives of Unsupervised Representations of Variables on the Latent Space
par: Glushkovsky, Alex
Publié: (2024)
par: Glushkovsky, Alex
Publié: (2024)
The Disagreement Problem in Explainable Machine Learning: A Practitioner's Perspective
par: Krishna, Satyapriya, et autres
Publié: (2022)
par: Krishna, Satyapriya, et autres
Publié: (2022)
Who Gets Credit or Blame? Attributing Accountability in Modern AI Systems
par: Zhang, Shichang, et autres
Publié: (2025)
par: Zhang, Shichang, et autres
Publié: (2025)
In-Context Explainers: Harnessing LLMs for Explaining Black Box Models
par: Kroeger, Nicholas, et autres
Publié: (2023)
par: Kroeger, Nicholas, et autres
Publié: (2023)
Interpretability Needs a New Paradigm
par: Madsen, Andreas, et autres
Publié: (2024)
par: Madsen, Andreas, et autres
Publié: (2024)
Follow My Instruction and Spill the Beans: Scalable Data Extraction from Retrieval-Augmented Generation Systems
par: Qi, Zhenting, et autres
Publié: (2024)
par: Qi, Zhenting, et autres
Publié: (2024)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
par: Lobo, Elita, et autres
Publié: (2024)
par: Lobo, Elita, et autres
Publié: (2024)
All Roads Lead to Likelihood: The Value of Reinforcement Learning in Fine-Tuning
par: Swamy, Gokul, et autres
Publié: (2025)
par: Swamy, Gokul, et autres
Publié: (2025)
Advancing Generalization in PINNs through Latent-Space Representations
par: Wang, Honghui, et autres
Publié: (2024)
par: Wang, Honghui, et autres
Publié: (2024)
AttackQA: Development and Adoption of a Dataset for Assisting Cybersecurity Operations using Fine-tuned and Open-Source LLMs
par: Krishna, Varun Badrinath
Publié: (2024)
par: Krishna, Varun Badrinath
Publié: (2024)
When No Paths Lead to Rome: Benchmarking Systematic Neural Relational Reasoning
par: Das, Anirban, et autres
Publié: (2025)
par: Das, Anirban, et autres
Publié: (2025)
A Deep Latent Space Model for Graph Representation Learning
par: Yang, Hanxuan, et autres
Publié: (2021)
par: Yang, Hanxuan, et autres
Publié: (2021)
EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling
par: Kouzelis, Theodoros, et autres
Publié: (2025)
par: Kouzelis, Theodoros, et autres
Publié: (2025)
OpenXAI: Towards a Transparent Evaluation of Model Explanations
par: Agarwal, Chirag, et autres
Publié: (2022)
par: Agarwal, Chirag, et autres
Publié: (2022)
If All Roads Lead to Rome, Why Are We in Athens?: School Library Media Programs and National Standards.
par: Barron, Daniel D.
Publié: (1997)
par: Barron, Daniel D.
Publié: (1997)
Quantification via Gaussian Latent Space Representations
par: Pérez-Mon, Olaya, et autres
Publié: (2025)
par: Pérez-Mon, Olaya, et autres
Publié: (2025)
Documents similaires
-
Interpreting CLIP with Sparse Linear Concept Embeddings (SpLiCE)
par: Bhalla, Usha, et autres
Publié: (2024) -
Discriminative Feature Attributions: Bridging Post Hoc Explainability and Inherent Interpretability
par: Bhalla, Usha, et autres
Publié: (2023) -
Operationalizing the Blueprint for an AI Bill of Rights: Recommendations for Practitioners, Researchers, and Policy Makers
par: Oesterling, Alex, et autres
Publié: (2024) -
Towards Unifying Interpretability and Control: Evaluation via Intervention
par: Bhalla, Usha, et autres
Publié: (2024) -
Evaluating Adversarial Robustness of Concept Representations in Sparse Autoencoders
par: Li, Aaron J., et autres
Publié: (2025)