Decoding Diffusion: A Scalable Framework for Unsupervised Analysis of Latent Space Biases and Representations Using Natural Language Prompts
Fuente:
arXiv
Guardado en:
| Autores principales: | Zeng, E. Zhixuan, Chen, Yuhao, Wong, Alexander |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Understanding the Limitations of Diffusion Concept Algebra Through Food
por: Zeng, E. Zhixuan, et al.
Publicado: (2024)
por: Zeng, E. Zhixuan, et al.
Publicado: (2024)
Disability Representations: Finding Biases in Automatic Image Generation
por: Tevissen, Yannis
Publicado: (2024)
por: Tevissen, Yannis
Publicado: (2024)
Detecting Offensive Memes with Social Biases in Singapore Context Using Multimodal Large Language Models
por: Yuxuan, Cao, et al.
Publicado: (2025)
por: Yuxuan, Cao, et al.
Publicado: (2025)
$λ$-ECLIPSE: Multi-Concept Personalized Text-to-Image Diffusion Models by Leveraging CLIP Latent Space
por: Patel, Maitreya, et al.
Publicado: (2024)
por: Patel, Maitreya, et al.
Publicado: (2024)
Studying and Mitigating Biases in Sign Language Understanding Models
por: Atwell, Katherine, et al.
Publicado: (2024)
por: Atwell, Katherine, et al.
Publicado: (2024)
Guiding Medical Vision-Language Models with Explicit Visual Prompts: Framework Design and Comprehensive Exploration of Prompt Variations
por: Zhu, Kangyu, et al.
Publicado: (2025)
por: Zhu, Kangyu, et al.
Publicado: (2025)
Using Prompts to Guide Large Language Models in Imitating a Real Person's Language Style
por: Chen, Ziyang, et al.
Publicado: (2024)
por: Chen, Ziyang, et al.
Publicado: (2024)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
por: Gu, Tiancheng, et al.
Publicado: (2024)
por: Gu, Tiancheng, et al.
Publicado: (2024)
LatentExplainer: Explaining Latent Representations in Deep Generative Models with Multimodal Large Language Models
por: Zhu, Mengdan, et al.
Publicado: (2024)
por: Zhu, Mengdan, et al.
Publicado: (2024)
Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification
por: Weng, Charles, et al.
Publicado: (2026)
por: Weng, Charles, et al.
Publicado: (2026)
Multimodal Latent Language Modeling with Next-Token Diffusion
por: Sun, Yutao, et al.
Publicado: (2024)
por: Sun, Yutao, et al.
Publicado: (2024)
Visually Guided Decoding: Gradient-Free Hard Prompt Inversion with Language Models
por: Kim, Donghoon, et al.
Publicado: (2025)
por: Kim, Donghoon, et al.
Publicado: (2025)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
por: Liu, Chengzhi, et al.
Publicado: (2025)
por: Liu, Chengzhi, et al.
Publicado: (2025)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
por: Huang, Jen-tse, et al.
Publicado: (2025)
por: Huang, Jen-tse, et al.
Publicado: (2025)
NAVIG: Natural Language-guided Analysis with Vision Language Models for Image Geo-localization
por: Zhang, Zheyuan, et al.
Publicado: (2025)
por: Zhang, Zheyuan, et al.
Publicado: (2025)
Beyond the Noise: Aligning Prompts with Latent Representations in Diffusion Models
por: Ramos, Vasco, et al.
Publicado: (2025)
por: Ramos, Vasco, et al.
Publicado: (2025)
Brain-CLIPLM: Decoding Compressed Semantic Representations in EEG for Language Reconstruction
por: Yang, Xiaoli, et al.
Publicado: (2026)
por: Yang, Xiaoli, et al.
Publicado: (2026)
Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts
por: Chin, Zhi-Yi, et al.
Publicado: (2023)
por: Chin, Zhi-Yi, et al.
Publicado: (2023)
Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
por: Chen, Meiqi, et al.
Publicado: (2024)
por: Chen, Meiqi, et al.
Publicado: (2024)
MAMA: Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation Learning
por: Nguyen, Thong, et al.
Publicado: (2024)
por: Nguyen, Thong, et al.
Publicado: (2024)
SignX: Continuous Sign Recognition in Compact Pose-Rich Latent Space
por: Fang, Sen, et al.
Publicado: (2025)
por: Fang, Sen, et al.
Publicado: (2025)
PinPoint: Prompting with Informative Interior Points
por: Sadeghi, Pouya, et al.
Publicado: (2026)
por: Sadeghi, Pouya, et al.
Publicado: (2026)
Modality-Agnostic fMRI Decoding of Vision and Language
por: Nikolaus, Mitja, et al.
Publicado: (2024)
por: Nikolaus, Mitja, et al.
Publicado: (2024)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
por: Jie, Shibo, et al.
Publicado: (2024)
por: Jie, Shibo, et al.
Publicado: (2024)
Retrieval-based Disentangled Representation Learning with Natural Language Supervision
por: Zhou, Jiawei, et al.
Publicado: (2022)
por: Zhou, Jiawei, et al.
Publicado: (2022)
Systemic Biases in Sign Language AI Research: A Deaf-Led Call to Reevaluate Research Agendas
por: Desai, Aashaka, et al.
Publicado: (2024)
por: Desai, Aashaka, et al.
Publicado: (2024)
Text Prompt Injection of Vision Language Models
por: Zhu, Ruizhe
Publicado: (2025)
por: Zhu, Ruizhe
Publicado: (2025)
Exploring the Design Space of Visual Context Representation in Video MLLMs
por: Du, Yifan, et al.
Publicado: (2024)
por: Du, Yifan, et al.
Publicado: (2024)
Ethology of Latent Spaces
por: Boisnard, Philippe
Publicado: (2026)
por: Boisnard, Philippe
Publicado: (2026)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
por: Li, Baiqi, et al.
Publicado: (2024)
por: Li, Baiqi, et al.
Publicado: (2024)
Agri-CPJ: A Training-Free Explainable Framework for Agricultural Pest Diagnosis Using Caption-Prompt-Judge and LLM-as-a-Judge
por: Zhang, Wentao, et al.
Publicado: (2026)
por: Zhang, Wentao, et al.
Publicado: (2026)
Using Images to Find Context-Independent Word Representations in Vector Space
por: Kumar, Harsh
Publicado: (2024)
por: Kumar, Harsh
Publicado: (2024)
SHuBERT: Self-Supervised Sign Language Representation Learning via Multi-Stream Cluster Prediction
por: Gueuwou, Shester, et al.
Publicado: (2024)
por: Gueuwou, Shester, et al.
Publicado: (2024)
VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI
por: Shakhadri, Syed Abdul Gaffar, et al.
Publicado: (2025)
por: Shakhadri, Syed Abdul Gaffar, et al.
Publicado: (2025)
Natural Language Inference Improves Compositionality in Vision-Language Models
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
por: Ji, Yatai, et al.
Publicado: (2024)
por: Ji, Yatai, et al.
Publicado: (2024)
Visual Representations inside the Language Model
por: Liu, Benlin, et al.
Publicado: (2025)
por: Liu, Benlin, et al.
Publicado: (2025)
Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
por: Byun, Sanghyun, et al.
Publicado: (2025)
por: Byun, Sanghyun, et al.
Publicado: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
por: Dai, Yifan, et al.
Publicado: (2026)
por: Dai, Yifan, et al.
Publicado: (2026)
Ejemplares similares
-
Understanding the Limitations of Diffusion Concept Algebra Through Food
por: Zeng, E. Zhixuan, et al.
Publicado: (2024) -
Disability Representations: Finding Biases in Automatic Image Generation
por: Tevissen, Yannis
Publicado: (2024) -
Detecting Offensive Memes with Social Biases in Singapore Context Using Multimodal Large Language Models
por: Yuxuan, Cao, et al.
Publicado: (2025) -
$λ$-ECLIPSE: Multi-Concept Personalized Text-to-Image Diffusion Models by Leveraging CLIP Latent Space
por: Patel, Maitreya, et al.
Publicado: (2024) -
Studying and Mitigating Biases in Sign Language Understanding Models
por: Atwell, Katherine, et al.
Publicado: (2024)