The Narrow Gate: Localized Image-Text Communication in Native Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Serra, Alessandro Pietro, Ortu, Francesco, Panizon, Emanuele, Valeriani, Lucrezia, Basile, Lorenzo, Ansuini, Alessio, Doimo, Diego, Cazzaniga, Alberto |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The representation landscape of few-shot learning and fine-tuning in large language models
par: Doimo, Diego, et autres
Publié: (2024)
par: Doimo, Diego, et autres
Publié: (2024)
When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models
par: Ortu, Francesco, et autres
Publié: (2025)
par: Ortu, Francesco, et autres
Publié: (2025)
Head Pursuit: Probing Attention Specialization in Multimodal Transformers
par: Basile, Lorenzo, et autres
Publié: (2025)
par: Basile, Lorenzo, et autres
Publié: (2025)
Emergent representations in networks trained with the Forward-Forward algorithm
par: Tosato, Niccolò, et autres
Publié: (2023)
par: Tosato, Niccolò, et autres
Publié: (2023)
Competition of Mechanisms: Tracing How Language Models Handle Facts and Counterfactuals
par: Ortu, Francesco, et autres
Publié: (2024)
par: Ortu, Francesco, et autres
Publié: (2024)
Optimal Control of a Mesoscopic Information Engine
par: Panizon, Emanuele
Publié: (2026)
par: Panizon, Emanuele
Publié: (2026)
SCHEMA for Gemini 3 Pro Image: A Structured Methodology for Controlled AI Image Generation on Google's Native Multimodal Model
par: Cazzaniga, Luca
Publié: (2026)
par: Cazzaniga, Luca
Publié: (2026)
Blending adversarial training and representation-conditional purification via aggregation improves adversarial robustness
par: Ballarin, Emanuele, et autres
Publié: (2023)
par: Ballarin, Emanuele, et autres
Publié: (2023)
Persistent Topological Features in Large Language Models
par: Gardinazzi, Yuri, et autres
Publié: (2024)
par: Gardinazzi, Yuri, et autres
Publié: (2024)
Olfactory search
par: Celani, Antonio, et autres
Publié: (2024)
par: Celani, Antonio, et autres
Publié: (2024)
An unsupervised tour through the hidden pathways of deep neural networks
par: Doimo, Diego
Publié: (2025)
par: Doimo, Diego
Publié: (2025)
Stable cooperation emerges in stochastic multiplicative growth
par: Fant, Lorenzo, et autres
Publié: (2022)
par: Fant, Lorenzo, et autres
Publié: (2022)
FIGURA: A Modular Prompt Engineering Method for Artistic Figure Photography in Safety-Filtered Text-to-Image Models
par: Cazzaniga, Luca
Publié: (2026)
par: Cazzaniga, Luca
Publié: (2026)
Interpreting and Steering Protein Language Models through Sparse Autoencoders
par: Garcia, Edith Natalia Villegas, et autres
Publié: (2025)
par: Garcia, Edith Natalia Villegas, et autres
Publié: (2025)
Density-Informed VAE (DiVAE): Reliable Log-Prior Probability via Density Alignment Regularization
par: Alessi, Michele, et autres
Publié: (2025)
par: Alessi, Michele, et autres
Publié: (2025)
Understanding and inverse design of implicit bias in stochastic learning: a geometric perspective
par: Aladrah, Nicola, et autres
Publié: (2026)
par: Aladrah, Nicola, et autres
Publié: (2026)
Are LLMs Good Safety Agents or a Propaganda Engine?
par: Yadav, Neemesh, et autres
Publié: (2025)
par: Yadav, Neemesh, et autres
Publié: (2025)
Understanding Variational Autoencoders with Intrinsic Dimension and Information Imbalance
par: Camboulin, Charles, et autres
Publié: (2024)
par: Camboulin, Charles, et autres
Publié: (2024)
Counterfactual rewards promote collective transport using individually controlled swarm microrobots
par: Heuthe, Veit-Lorenz, et autres
Publié: (2024)
par: Heuthe, Veit-Lorenz, et autres
Publié: (2024)
Preserving Historical Truth: Detecting Historical Revisionism in Large Language Models
par: Ortu, Francesco, et autres
Publié: (2026)
par: Ortu, Francesco, et autres
Publié: (2026)
Detach-ROCKET: Sequential feature selection for time series classification with random convolutional kernels
par: Uribarri, Gonzalo, et autres
Publié: (2023)
par: Uribarri, Gonzalo, et autres
Publié: (2023)
Narrowing Information Bottleneck Theory for Multimodal Image-Text Representations Interpretability
par: Zhu, Zhiyu, et autres
Publié: (2025)
par: Zhu, Zhiyu, et autres
Publié: (2025)
ResiDual Transformer Alignment with Spectral Decomposition
par: Basile, Lorenzo, et autres
Publié: (2024)
par: Basile, Lorenzo, et autres
Publié: (2024)
Perceptual misalignment of texture representations in convolutional neural networks
par: de Paolis, Ludovica, et autres
Publié: (2026)
par: de Paolis, Ludovica, et autres
Publié: (2026)
Zigzag Persistence of Neural Responses to Time-Varying Stimuli
par: Gardinazzi, Yuri, et autres
Publié: (2026)
par: Gardinazzi, Yuri, et autres
Publié: (2026)
Moment maps and stability of holomorphic submersions
par: Ortu, Annamaria
Publié: (2024)
par: Ortu, Annamaria
Publié: (2024)
Age determination of sediment core MONDOVI, Refugio Mondovi, Italy
par: Ortu, Elena
Publié: (2010)
par: Ortu, Elena
Publié: (2010)
Age determination of sediment core BIECAI, Torbiera del Biecai, Italy
par: Ortu, Elena
Publié: (2010)
par: Ortu, Elena
Publié: (2010)
Pollen profile MONDOVI, Refugio Mondovi, Italy
par: Ortu, Elena
Publié: (2010)
par: Ortu, Elena
Publié: (2010)
Age determination of sediment core FATE, Lago delle Fate, Italy
par: Ortu, Elena
Publié: (2010)
par: Ortu, Elena
Publié: (2010)
Age determination of sediment core ORGIALS, Laghi dellOrgials, Italy
par: Ortu, Elena
Publié: (2010)
par: Ortu, Elena
Publié: (2010)
Pollen profile FATE, Lago delle Fate, Italy
par: Ortu, Elena
Publié: (2010)
par: Ortu, Elena
Publié: (2010)
Pollen profile BIECAI, Torbiera del Biecai, Italy
par: Ortu, Elena
Publié: (2010)
par: Ortu, Elena
Publié: (2010)
Pollen profile ORGIALS, Laghi dellOrgials, Italy
par: Ortu, Elena
Publié: (2010)
par: Ortu, Elena
Publié: (2010)
Bounding Box-Guided Diffusion for Synthesizing Industrial Images and Segmentation Map
par: Caruso, Emanuele, et autres
Publié: (2025)
par: Caruso, Emanuele, et autres
Publié: (2025)
Evaluation of sorption isotherms in snacks with pregelatinized cassava
par: Amanda Cazzaniga
Publié: (2022)
par: Amanda Cazzaniga
Publié: (2022)
Usos escolares de Internet en adolescentes de sectores populares
par: Diego Basile
Publié: (2013)
par: Diego Basile
Publié: (2013)
Sentinel2Cap: A Human-Annotated Benchmark Dataset for Multimodal Remote Sensing Image Captioning
par: Tosato, Lucrezia, et autres
Publié: (2026)
par: Tosato, Lucrezia, et autres
Publié: (2026)
I2EDL: Interactive Instruction Error Detection and Localization
par: Taioli, Francesco, et autres
Publié: (2024)
par: Taioli, Francesco, et autres
Publié: (2024)
Emergence of a High-Dimensional Abstraction Phase in Language Transformers
par: Cheng, Emily, et autres
Publié: (2024)
par: Cheng, Emily, et autres
Publié: (2024)
Documents similaires
-
The representation landscape of few-shot learning and fine-tuning in large language models
par: Doimo, Diego, et autres
Publié: (2024) -
When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models
par: Ortu, Francesco, et autres
Publié: (2025) -
Head Pursuit: Probing Attention Specialization in Multimodal Transformers
par: Basile, Lorenzo, et autres
Publié: (2025) -
Emergent representations in networks trained with the Forward-Forward algorithm
par: Tosato, Niccolò, et autres
Publié: (2023) -
Competition of Mechanisms: Tracing How Language Models Handle Facts and Counterfactuals
par: Ortu, Francesco, et autres
Publié: (2024)