Improving Latent Generalization Using Test-time Compute
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chaudhry, Arslan, Thiagarajan, Sridhar, Lampinen, Andrew |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Finetuning Language Models to Emit Linguistic Expressions of Uncertainty
par: Chaudhry, Arslan, et autres
Publié: (2024)
par: Chaudhry, Arslan, et autres
Publié: (2024)
Latent learning: episodic memory complements parametric learning by enabling flexible reuse of experiences
par: Lampinen, Andrew Kyle, et autres
Publié: (2025)
par: Lampinen, Andrew Kyle, et autres
Publié: (2025)
Interpretability Illusions in the Generalization of Simplified Models
par: Friedman, Dan, et autres
Publié: (2023)
par: Friedman, Dan, et autres
Publié: (2023)
Distinct Computations Emerge From Compositional Curricula in In-Context Learning
par: Lee, Jin Hwa, et autres
Publié: (2025)
par: Lee, Jin Hwa, et autres
Publié: (2025)
Implicit Statistical Inference in Transformers: Approximating Likelihood-Ratio Tests In-Context
par: Chaudhry, Faris, et autres
Publié: (2026)
par: Chaudhry, Faris, et autres
Publié: (2026)
On the generalization of language models from in-context learning and finetuning: a controlled study
par: Lampinen, Andrew K., et autres
Publié: (2025)
par: Lampinen, Andrew K., et autres
Publié: (2025)
ExpTest: Automating Learning Rate Searching and Tuning with Insights from Linearized Neural Networks
par: Chaudhry, Zan, et autres
Publié: (2024)
par: Chaudhry, Zan, et autres
Publié: (2024)
Jensen-Shannon Divergence Based Novel Loss Functions for Bayesian Neural Networks
par: Thiagarajan, Ponkrshnan, et autres
Publié: (2022)
par: Thiagarajan, Ponkrshnan, et autres
Publié: (2022)
Universal Reinforcement Learning in Coalgebras: Asynchronous Stochastic Computation via Conduction
par: Mahadevan, Sridhar
Publié: (2025)
par: Mahadevan, Sridhar
Publié: (2025)
Improving Routability Prediction via NAS Using a Smooth One-shot Augmented Predictor
par: Sridhar, Arjun, et autres
Publié: (2024)
par: Sridhar, Arjun, et autres
Publié: (2024)
Latent Regularization in Generative Test Input Generation
par: Merabishvili, Giorgi, et autres
Publié: (2026)
par: Merabishvili, Giorgi, et autres
Publié: (2026)
A Comparative Analysis of LLM Adaptation: SFT, LoRA, and ICL in Data-Scarce Scenarios
par: Bohnet, Bernd, et autres
Publié: (2025)
par: Bohnet, Bernd, et autres
Publié: (2025)
The Geometry of Projection Heads: Conditioning, Invariance, and Collapse
par: Chaudhry, Faris
Publié: (2026)
par: Chaudhry, Faris
Publié: (2026)
Non-Interfering Weight Fields: Treating Model Parameters as a Continuously Extensible Function
par: Chaudhry, Sarim
Publié: (2026)
par: Chaudhry, Sarim
Publié: (2026)
Asymptotic and Finite-Time Guarantees for Langevin-Based Temperature Annealing in InfoNCE
par: Chaudhry, Faris
Publié: (2026)
par: Chaudhry, Faris
Publié: (2026)
General Preference Reinforcement Learning
par: Umer, Muhammad, et autres
Publié: (2026)
par: Umer, Muhammad, et autres
Publié: (2026)
GAIA: Categorical Foundations of Generative AI
par: Mahadevan, Sridhar
Publié: (2024)
par: Mahadevan, Sridhar
Publié: (2024)
Learned feature representations are biased by complexity, learning order, position, and more
par: Lampinen, Andrew Kyle, et autres
Publié: (2024)
par: Lampinen, Andrew Kyle, et autres
Publié: (2024)
ChronoPlastic Spiking Neural Networks
par: Chaudhry, Sarim
Publié: (2025)
par: Chaudhry, Sarim
Publié: (2025)
A Simple Sparse Matrix Vector Multiplication Approach to Padded Convolution
par: Chaudhry, Zan
Publié: (2024)
par: Chaudhry, Zan
Publié: (2024)
Linear representations in language models can change dramatically over a conversation
par: Lampinen, Andrew Kyle, et autres
Publié: (2026)
par: Lampinen, Andrew Kyle, et autres
Publié: (2026)
Representation biases: will we achieve complete understanding by analyzing representations?
par: Lampinen, Andrew Kyle, et autres
Publié: (2025)
par: Lampinen, Andrew Kyle, et autres
Publié: (2025)
Data Distribution-based Curriculum Learning
par: Chaudhry, Shonal, et autres
Publié: (2024)
par: Chaudhry, Shonal, et autres
Publié: (2024)
GLAD: Improving Latent Graph Generative Modeling with Simple Quantization
par: Nguyen, Van Khoa, et autres
Publié: (2024)
par: Nguyen, Van Khoa, et autres
Publié: (2024)
Recursive Concept Evolution for Compositional Reasoning in Large Language Models
par: Chaudhry, Sarim
Publié: (2026)
par: Chaudhry, Sarim
Publié: (2026)
Scaling Laws and Pathologies of Single-Layer PINNs: Network Width and PDE Nonlinearity
par: Chaudhry, Faris
Publié: (2026)
par: Chaudhry, Faris
Publié: (2026)
The in-context inductive biases of vision-language models differ across modalities
par: Allen, Kelsey, et autres
Publié: (2025)
par: Allen, Kelsey, et autres
Publié: (2025)
The broader spectrum of in-context learning
par: Lampinen, Andrew Kyle, et autres
Publié: (2024)
par: Lampinen, Andrew Kyle, et autres
Publié: (2024)
How do language models learn facts? Dynamics, curricula and hallucinations
par: Zucchet, Nicolas, et autres
Publié: (2025)
par: Zucchet, Nicolas, et autres
Publié: (2025)
The emergence of sparse attention: impact of data distribution and benefits of repetition
par: Zucchet, Nicolas, et autres
Publié: (2025)
par: Zucchet, Nicolas, et autres
Publié: (2025)
Universal Decision Learners
par: Mahadevan, Sridhar
Publié: (2026)
par: Mahadevan, Sridhar
Publié: (2026)
Kan Extension Transformers: A Categorical Unification of Attention, Diffusion, and Predict-Detach Self-Conditioning
par: Mahadevan, Sridhar
Publié: (2026)
par: Mahadevan, Sridhar
Publié: (2026)
PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents
par: Yan, Minghao, et autres
Publié: (2026)
par: Yan, Minghao, et autres
Publié: (2026)
EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling
par: Kouzelis, Theodoros, et autres
Publié: (2025)
par: Kouzelis, Theodoros, et autres
Publié: (2025)
Improving the Generation of VAEs with High Dimensional Latent Spaces by the use of Hyperspherical Coordinates
par: Ascarate, Alejandro, et autres
Publié: (2025)
par: Ascarate, Alejandro, et autres
Publié: (2025)
Generative Modeling of Discrete Data Using Geometric Latent Subspaces
par: Gonzalez-Alvarado, Daniel, et autres
Publié: (2026)
par: Gonzalez-Alvarado, Daniel, et autres
Publié: (2026)
Bridging Quantum and Classical Computing in Drug Design: Architecture Principles for Improved Molecule Generation
par: Smith, Andrew, et autres
Publié: (2025)
par: Smith, Andrew, et autres
Publié: (2025)
Deep Learning-Based Visual Fatigue Detection Using Eye Gaze Patterns in VR
par: Zafar, Numan, et autres
Publié: (2025)
par: Zafar, Numan, et autres
Publié: (2025)
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
par: Geiping, Jonas, et autres
Publié: (2025)
par: Geiping, Jonas, et autres
Publié: (2025)
Enhancing Latent Computation in Transformers with Latent Tokens
par: Sun, Yuchang, et autres
Publié: (2025)
par: Sun, Yuchang, et autres
Publié: (2025)
Documents similaires
-
Finetuning Language Models to Emit Linguistic Expressions of Uncertainty
par: Chaudhry, Arslan, et autres
Publié: (2024) -
Latent learning: episodic memory complements parametric learning by enabling flexible reuse of experiences
par: Lampinen, Andrew Kyle, et autres
Publié: (2025) -
Interpretability Illusions in the Generalization of Simplified Models
par: Friedman, Dan, et autres
Publié: (2023) -
Distinct Computations Emerge From Compositional Curricula in In-Context Learning
par: Lee, Jin Hwa, et autres
Publié: (2025) -
Implicit Statistical Inference in Transformers: Approximating Likelihood-Ratio Tests In-Context
par: Chaudhry, Faris, et autres
Publié: (2026)