Enregistré dans:
| Auteurs principaux: | Song, Jiajun, Zhong, Yiqiao |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2310.04861 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Out-of-distribution generalization via composition: a lens through induction heads in Transformers
par: Song, Jiajun, et autres
Publié: (2024)
par: Song, Jiajun, et autres
Publié: (2024)
VARMA-Enhanced Transformer for Time Series Forecasting
par: Song, Jiajun, et autres
Publié: (2025)
par: Song, Jiajun, et autres
Publié: (2025)
Proposing and solving olympiad geometry with guided tree search
par: Zhang, Chi, et autres
Publié: (2024)
par: Zhang, Chi, et autres
Publié: (2024)
Shattered Compositionality: Counterintuitive Learning Dynamics of Transformers for Arithmetic
par: Zhao, Xingyu, et autres
Publié: (2026)
par: Zhao, Xingyu, et autres
Publié: (2026)
Uncovering mesa-optimization algorithms in Transformers
par: von Oswald, Johannes, et autres
Publié: (2023)
par: von Oswald, Johannes, et autres
Publié: (2023)
Sparse deepfake detection promotes better disentanglement
par: Teissier, Antoine, et autres
Publié: (2025)
par: Teissier, Antoine, et autres
Publié: (2025)
Uncovering Graph Reasoning in Decoder-only Transformers with Circuit Tracing
par: Dai, Xinnan, et autres
Publié: (2025)
par: Dai, Xinnan, et autres
Publié: (2025)
Bypassing the Exponential Dependency: Looped Transformers Efficiently Learn In-context by Multi-step Gradient Descent
par: Chen, Bo, et autres
Publié: (2024)
par: Chen, Bo, et autres
Publié: (2024)
How Does Unfaithful Reasoning Emerge from Autoregressive Training? A Study of Synthetic Experiments
par: Wang, Fuxin, et autres
Publié: (2026)
par: Wang, Fuxin, et autres
Publié: (2026)
Uncovering Layer-Dependent Activation Sparsity Patterns in ReLU Transformers
par: Wild, Cody, et autres
Publié: (2024)
par: Wild, Cody, et autres
Publié: (2024)
Retrieval-Augmented Decision Transformer: External Memory for In-context RL
par: Schmied, Thomas, et autres
Publié: (2024)
par: Schmied, Thomas, et autres
Publié: (2024)
Advancing Few-Shot Pediatric Arrhythmia Classification with a Novel Contrastive Loss and Multimodal Learning
par: Chen, Yiqiao, et autres
Publié: (2025)
par: Chen, Yiqiao, et autres
Publié: (2025)
Single- to multi-fidelity history-dependent learning with uncertainty quantification and disentanglement: application to data-driven constitutive modeling
par: Yi, Jiaxiang, et autres
Publié: (2025)
par: Yi, Jiaxiang, et autres
Publié: (2025)
Subliminal Learning: Language models transmit behavioral traits via hidden signals in data
par: Cloud, Alex, et autres
Publié: (2025)
par: Cloud, Alex, et autres
Publié: (2025)
Pre-trained Transformer Uncovers Meaningful Patterns in Human Mobility Data
par: Najjar, Alameen
Publié: (2024)
par: Najjar, Alameen
Publié: (2024)
Variational decomposition autoencoding improves disentanglement of latent representations
par: Ziogas, Ioannis, et autres
Publié: (2026)
par: Ziogas, Ioannis, et autres
Publié: (2026)
Can Looped Transformers Learn to Implement Multi-step Gradient Descent for In-context Learning?
par: Gatmiry, Khashayar, et autres
Publié: (2024)
par: Gatmiry, Khashayar, et autres
Publié: (2024)
BrainHGT: A Hierarchical Graph Transformer for Interpretable Brain Network Analysis
par: Ma, Jiajun, et autres
Publié: (2025)
par: Ma, Jiajun, et autres
Publié: (2025)
Enhanced Transformer architecture for in-context learning of dynamical systems
par: Rufolo, Matteo, et autres
Publié: (2024)
par: Rufolo, Matteo, et autres
Publié: (2024)
TabMDA: Tabular Manifold Data Augmentation for Any Classifier using Transformers with In-context Subsetting
par: Margeloiu, Andrei, et autres
Publié: (2024)
par: Margeloiu, Andrei, et autres
Publié: (2024)
Transferring disentangled representations: bridging the gap between synthetic and real images
par: Dapueto, Jacopo, et autres
Publié: (2024)
par: Dapueto, Jacopo, et autres
Publié: (2024)
ICPL: Few-shot In-context Preference Learning via LLMs
par: Yu, Chao, et autres
Publié: (2024)
par: Yu, Chao, et autres
Publié: (2024)
How Well Can Transformers Emulate In-context Newton's Method?
par: Giannou, Angeliki, et autres
Publié: (2024)
par: Giannou, Angeliki, et autres
Publié: (2024)
Implicit In-context Learning
par: Li, Zhuowei, et autres
Publié: (2024)
par: Li, Zhuowei, et autres
Publié: (2024)
Uncovering the Structure of Explanation Quality with Spectral Analysis
par: Maeß, Johannes, et autres
Publié: (2025)
par: Maeß, Johannes, et autres
Publié: (2025)
Uncovering the Latent Potential of Deep Intermediate Representations
par: Batra, Arnesh, et autres
Publié: (2026)
par: Batra, Arnesh, et autres
Publié: (2026)
Uncovering Emergent Physics Representations Learned In-Context by Large Language Models
par: Song, Yeongwoo, et autres
Publié: (2025)
par: Song, Yeongwoo, et autres
Publié: (2025)
You are out of context!
par: Cobino, Giancarlo, et autres
Publié: (2024)
par: Cobino, Giancarlo, et autres
Publié: (2024)
Auditing language models for hidden objectives
par: Marks, Samuel, et autres
Publié: (2025)
par: Marks, Samuel, et autres
Publié: (2025)
TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization
par: Fu, Lucheng, et autres
Publié: (2026)
par: Fu, Lucheng, et autres
Publié: (2026)
pyrtklib: An open-source package for tightly coupled deep learning and GNSS integration for positioning in urban canyons
par: Hu, Runzhi, et autres
Publié: (2024)
par: Hu, Runzhi, et autres
Publié: (2024)
Uncovering Capabilities of Model Pruning in Graph Contrastive Learning
par: Wu, Junran, et autres
Publié: (2024)
par: Wu, Junran, et autres
Publié: (2024)
Uncovering the Spectral Bias in Diagonal State Space Models
par: Solozabal, Ruben, et autres
Publié: (2025)
par: Solozabal, Ruben, et autres
Publié: (2025)
In-context learning and Occam's razor
par: Elmoznino, Eric, et autres
Publié: (2024)
par: Elmoznino, Eric, et autres
Publié: (2024)
Analyzing limits for in-context learning
par: Naim, Omar, et autres
Publié: (2025)
par: Naim, Omar, et autres
Publié: (2025)
Uncovering Scaling Laws for Large Language Models via Inverse Problems
par: Verma, Arun, et autres
Publié: (2025)
par: Verma, Arun, et autres
Publié: (2025)
CACTUS: a Comprehensive Abstraction and Classification Tool for Uncovering Structures
par: Gherardini, Luca, et autres
Publié: (2023)
par: Gherardini, Luca, et autres
Publié: (2023)
ChatGPT Code Detection: Techniques for Uncovering the Source of Code
par: Oedingen, Marc, et autres
Publié: (2024)
par: Oedingen, Marc, et autres
Publié: (2024)
Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces
par: Chowdhury, Sanjoy, et autres
Publié: (2026)
par: Chowdhury, Sanjoy, et autres
Publié: (2026)
Uncovering Gradient Inversion Risks in Practical Language Model Training
par: Feng, Xinguo, et autres
Publié: (2025)
par: Feng, Xinguo, et autres
Publié: (2025)
Documents similaires
-
Out-of-distribution generalization via composition: a lens through induction heads in Transformers
par: Song, Jiajun, et autres
Publié: (2024) -
VARMA-Enhanced Transformer for Time Series Forecasting
par: Song, Jiajun, et autres
Publié: (2025) -
Proposing and solving olympiad geometry with guided tree search
par: Zhang, Chi, et autres
Publié: (2024) -
Shattered Compositionality: Counterintuitive Learning Dynamics of Transformers for Arithmetic
par: Zhao, Xingyu, et autres
Publié: (2026) -
Uncovering mesa-optimization algorithms in Transformers
par: von Oswald, Johannes, et autres
Publié: (2023)