Meta-Models: An Architecture for Decoding LLM Behaviors Through Interpreted Embeddings and Natural Language
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Costarelli, Anthony, Allen, Mat, Field, Severin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Intrinsic-Energy Joint Embedding Predictive Architectures Induce Quasimetric Spaces
par: Kobanda, Anthony, et autres
Publié: (2026)
par: Kobanda, Anthony, et autres
Publié: (2026)
ctELM: Decoding and Manipulating Embeddings of Clinical Trials with Embedding Language Models
par: Ondov, Brian, et autres
Publié: (2026)
par: Ondov, Brian, et autres
Publié: (2026)
Beyond Isolated Clients: Integrating Graph-Based Embeddings into Event Sequence Models
par: Proshian, Harry, et autres
Publié: (2026)
par: Proshian, Harry, et autres
Publié: (2026)
SelfIE: Self-Interpretation of Large Language Model Embeddings
par: Chen, Haozhe, et autres
Publié: (2024)
par: Chen, Haozhe, et autres
Publié: (2024)
The Dual-Stream Transformer: Channelized Architecture for Interpretable Language Modeling
par: Kerce, J. Clayton, et autres
Publié: (2026)
par: Kerce, J. Clayton, et autres
Publié: (2026)
Mechanistic Interpretability of Fine-Tuned Vision Transformers on Distorted Images: Decoding Attention Head Behavior for Transparent and Trustworthy AI
par: Bahador, Nooshin
Publié: (2025)
par: Bahador, Nooshin
Publié: (2025)
Interpretable Robot Control via Structured Behavior Trees and Large Language Models
par: Chekam, Ingrid Maéva, et autres
Publié: (2025)
par: Chekam, Ingrid Maéva, et autres
Publié: (2025)
Meta Additive Model: Interpretable Sparse Learning With Auto Weighting
par: Zhang, Xuelin, et autres
Publié: (2026)
par: Zhang, Xuelin, et autres
Publié: (2026)
Concept Tokens: Learning Behavioral Embeddings Through Concept Definitions
par: Sastre, Ignacio, et autres
Publié: (2026)
par: Sastre, Ignacio, et autres
Publié: (2026)
Interpreting Language Models Through Concept Descriptions: A Survey
par: Feldhus, Nils, et autres
Publié: (2025)
par: Feldhus, Nils, et autres
Publié: (2025)
Interpretable Perturbation Modeling Through Biomedical Knowledge Graphs
par: Passigan, Pascal, et autres
Publié: (2025)
par: Passigan, Pascal, et autres
Publié: (2025)
Discovering Chunks in Neural Embeddings for Interpretability
par: Wu, Shuchen, et autres
Publié: (2025)
par: Wu, Shuchen, et autres
Publié: (2025)
Hyperdimensional Probe: Decoding LLM Representations via Vector Symbolic Architectures
par: Bronzini, Marco, et autres
Publié: (2025)
par: Bronzini, Marco, et autres
Publié: (2025)
Integrating Meta-Features with Knowledge Graph Embeddings for Meta-Learning
par: Klironomos, Antonis, et autres
Publié: (2026)
par: Klironomos, Antonis, et autres
Publié: (2026)
A General Framework for Producing Interpretable Semantic Text Embeddings
par: Sun, Yiqun, et autres
Publié: (2024)
par: Sun, Yiqun, et autres
Publié: (2024)
Decoding Latent Spaces: Assessing the Interpretability of Time Series Foundation Models for Visual Analytics
par: Santamaria-Valenzuela, Inmaculada, et autres
Publié: (2025)
par: Santamaria-Valenzuela, Inmaculada, et autres
Publié: (2025)
Autonomous Behavior Planning For Humanoid Loco-manipulation Through Grounded Language Model
par: Wang, Jin, et autres
Publié: (2024)
par: Wang, Jin, et autres
Publié: (2024)
Nature Language Model: Deciphering the Language of Nature for Scientific Discovery
par: Xia, Yingce, et autres
Publié: (2025)
par: Xia, Yingce, et autres
Publié: (2025)
EmbedLLM: Learning Compact Representations of Large Language Models
par: Zhuang, Richard, et autres
Publié: (2024)
par: Zhuang, Richard, et autres
Publié: (2024)
Interpreting Outliers in Time Series Data through Decoding Autoencoder
par: Knab, Patrick, et autres
Publié: (2024)
par: Knab, Patrick, et autres
Publié: (2024)
BEACON: Behavioral Malware Classification with Large Language Model Embeddings and Deep Learning
par: Perera, Wadduwage Shanika, et autres
Publié: (2025)
par: Perera, Wadduwage Shanika, et autres
Publié: (2025)
LLM4GNAS: A Large Language Model Based Toolkit for Graph Neural Architecture Search
par: Gao, Yang, et autres
Publié: (2025)
par: Gao, Yang, et autres
Publié: (2025)
Tokenized Bandit for LLM Decoding and Alignment
par: Shin, Suho, et autres
Publié: (2025)
par: Shin, Suho, et autres
Publié: (2025)
Beyond the Answer: Decoding the Behavior of LLMs as Scientific Reasoners
par: Pandey, Rohan, et autres
Publié: (2026)
par: Pandey, Rohan, et autres
Publié: (2026)
LLM-FS-Agent: A Deliberative Role-based Large Language Model Architecture for Transparent Feature Selection
par: Bal-Ghaoui, Mohamed, et autres
Publié: (2025)
par: Bal-Ghaoui, Mohamed, et autres
Publié: (2025)
BONSAI: Bayesian Optimization with Natural Simplicity and Interpretability
par: Daulton, Samuel, et autres
Publié: (2026)
par: Daulton, Samuel, et autres
Publié: (2026)
Distributed Interpretability and Control for Large Language Models
par: Desai, Dev Arpan, et autres
Publié: (2026)
par: Desai, Dev Arpan, et autres
Publié: (2026)
Interpretable-by-Design Transformers via Architectural Stream Independence
par: Kerce, Clayton, et autres
Publié: (2026)
par: Kerce, Clayton, et autres
Publié: (2026)
AIOS Compiler: LLM as Interpreter for Natural Language Programming and Flow Programming of AI Agents
par: Xu, Shuyuan, et autres
Publié: (2024)
par: Xu, Shuyuan, et autres
Publié: (2024)
Meta-cognitive Multi-scale Hierarchical Reasoning for Motor Imagery Decoding
par: Kim, Si-Hyun, et autres
Publié: (2025)
par: Kim, Si-Hyun, et autres
Publié: (2025)
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
par: Jiang, Nick, et autres
Publié: (2025)
par: Jiang, Nick, et autres
Publié: (2025)
Embedded Quantum Machine Learning in Embedded Systems: Feasibility, Hybrid Architectures, and Quantum Co-Processors
par: Dey, Somdip, et autres
Publié: (2026)
par: Dey, Somdip, et autres
Publié: (2026)
Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
par: Lee, Sanghyun, et autres
Publié: (2025)
par: Lee, Sanghyun, et autres
Publié: (2025)
Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
par: Arriola, Marianne, et autres
Publié: (2025)
par: Arriola, Marianne, et autres
Publié: (2025)
Robust Multi-Objective Controlled Decoding of Large Language Models
par: Son, Seongho, et autres
Publié: (2025)
par: Son, Seongho, et autres
Publié: (2025)
NEZHA: A Zero-sacrifice and Hyperspeed Decoding Architecture for Generative Recommendations
par: Wang, Yejing, et autres
Publié: (2025)
par: Wang, Yejing, et autres
Publié: (2025)
GradMetaNet: An Equivariant Architecture for Learning on Gradients
par: Gelberg, Yoav, et autres
Publié: (2025)
par: Gelberg, Yoav, et autres
Publié: (2025)
Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability
par: Bhalla, Usha, et autres
Publié: (2025)
par: Bhalla, Usha, et autres
Publié: (2025)
LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels
par: Maes, Lucas, et autres
Publié: (2026)
par: Maes, Lucas, et autres
Publié: (2026)
Massive Activations in Graph Neural Networks: Decoding Attention for Domain-Dependent Interpretability
par: Bini, Lorenzo, et autres
Publié: (2024)
par: Bini, Lorenzo, et autres
Publié: (2024)
Documents similaires
-
Intrinsic-Energy Joint Embedding Predictive Architectures Induce Quasimetric Spaces
par: Kobanda, Anthony, et autres
Publié: (2026) -
ctELM: Decoding and Manipulating Embeddings of Clinical Trials with Embedding Language Models
par: Ondov, Brian, et autres
Publié: (2026) -
Beyond Isolated Clients: Integrating Graph-Based Embeddings into Event Sequence Models
par: Proshian, Harry, et autres
Publié: (2026) -
SelfIE: Self-Interpretation of Large Language Model Embeddings
par: Chen, Haozhe, et autres
Publié: (2024) -
The Dual-Stream Transformer: Channelized Architecture for Interpretable Language Modeling
par: Kerce, J. Clayton, et autres
Publié: (2026)