Guardado en:
| Autores principales: | Fan, Ying, Du, Yilun, Ramchandran, Kannan, Lee, Kangwook |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2409.15647 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Optimizing DDPM Sampling with Shortcut Fine-Tuning
por: Fan, Ying, et al.
Publicado: (2023)
por: Fan, Ying, et al.
Publicado: (2023)
Self-Improving Transformers Overcome Easy-to-Hard and Length Generalization Challenges
por: Lee, Nayoung, et al.
Publicado: (2025)
por: Lee, Nayoung, et al.
Publicado: (2025)
Looped Transformers are Better at Learning Learning Algorithms
por: Yang, Liu, et al.
Publicado: (2023)
por: Yang, Liu, et al.
Publicado: (2023)
Adaptive Sparse Möbius Transforms for Learning Polynomials
por: Erginbas, Yigit Efe, et al.
Publicado: (2026)
por: Erginbas, Yigit Efe, et al.
Publicado: (2026)
Toward a Theory of Tokenization in LLMs
por: Rajaraman, Nived, et al.
Publicado: (2024)
por: Rajaraman, Nived, et al.
Publicado: (2024)
Learning to Understand: Identifying Interactions via the Möbius Transform
por: Kang, Justin S., et al.
Publicado: (2024)
por: Kang, Justin S., et al.
Publicado: (2024)
The Fair Value of Data Under Heterogeneous Privacy Constraints in Federated Learning
por: Kang, Justin, et al.
Publicado: (2023)
por: Kang, Justin, et al.
Publicado: (2023)
Transformers on Markov Data: Constant Depth Suffices
por: Rajaraman, Nived, et al.
Publicado: (2024)
por: Rajaraman, Nived, et al.
Publicado: (2024)
Statistical Complexity and Optimal Algorithms for Non-linear Ridge Bandits
por: Rajaraman, Nived, et al.
Publicado: (2023)
por: Rajaraman, Nived, et al.
Publicado: (2023)
VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data
por: Zeng, Thomas, et al.
Publicado: (2025)
por: Zeng, Thomas, et al.
Publicado: (2025)
Online Assortment and Price Optimization Under Contextual Choice Models
por: Erginbas, Yigit Efe, et al.
Publicado: (2025)
por: Erginbas, Yigit Efe, et al.
Publicado: (2025)
Dual Operating Modes of In-Context Learning
por: Lin, Ziqian, et al.
Publicado: (2024)
por: Lin, Ziqian, et al.
Publicado: (2024)
Towards Anytime-Valid Statistical Watermarking
por: Huang, Baihe, et al.
Publicado: (2026)
por: Huang, Baihe, et al.
Publicado: (2026)
Human-in-the-Loop Systems for Adaptive Learning Using Generative AI
por: Tarun, Bhavishya, et al.
Publicado: (2025)
por: Tarun, Bhavishya, et al.
Publicado: (2025)
An Odd Estimator for Shapley Values
por: Fumagalli, Fabian, et al.
Publicado: (2026)
por: Fumagalli, Fabian, et al.
Publicado: (2026)
Quantitative Bounds for Length Generalization in Transformers
por: Izzo, Zachary, et al.
Publicado: (2025)
por: Izzo, Zachary, et al.
Publicado: (2025)
The Expressive Power of Low-Rank Adaptation
por: Zeng, Yuchen, et al.
Publicado: (2023)
por: Zeng, Yuchen, et al.
Publicado: (2023)
EmbedLLM: Learning Compact Representations of Large Language Models
por: Zhuang, Richard, et al.
Publicado: (2024)
por: Zhuang, Richard, et al.
Publicado: (2024)
Any-Order Flexible Length Masked Diffusion
por: Kim, Jaeyeon, et al.
Publicado: (2025)
por: Kim, Jaeyeon, et al.
Publicado: (2025)
A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior
por: Mayne, Harry, et al.
Publicado: (2026)
por: Mayne, Harry, et al.
Publicado: (2026)
Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models
por: Lee, Chungpa, et al.
Publicado: (2026)
por: Lee, Chungpa, et al.
Publicado: (2026)
In-Context Learning with Hypothesis-Class Guidance
por: Lin, Ziqian, et al.
Publicado: (2025)
por: Lin, Ziqian, et al.
Publicado: (2025)
Cross-Cluster Weighted Forests
por: Ramchandran, Maya, et al.
Publicado: (2021)
por: Ramchandran, Maya, et al.
Publicado: (2021)
ProxySPEX: Inference-Efficient Interpretability via Sparse Feature Interactions in LLMs
por: Butler, Landon, et al.
Publicado: (2025)
por: Butler, Landon, et al.
Publicado: (2025)
Towards Optimal Statistical Watermarking
por: Huang, Baihe, et al.
Publicado: (2023)
por: Huang, Baihe, et al.
Publicado: (2023)
Memorization Capacity for Additive Fine-Tuning with Small ReLU Networks
por: Sohn, Jy-yong, et al.
Publicado: (2024)
por: Sohn, Jy-yong, et al.
Publicado: (2024)
Transformers in the Dark: Navigating Unknown Search Spaces via Bandit Feedback
por: Kim, Jungtaek, et al.
Publicado: (2026)
por: Kim, Jungtaek, et al.
Publicado: (2026)
Sample Complexity and Representation Ability of Test-time Scaling Paradigms
por: Huang, Baihe, et al.
Publicado: (2025)
por: Huang, Baihe, et al.
Publicado: (2025)
Variation Spaces for Multi-Output Neural Networks: Insights on Multi-Task Learning and Network Compression
por: Shenouda, Joseph, et al.
Publicado: (2023)
por: Shenouda, Joseph, et al.
Publicado: (2023)
Contextual Feedback Loops: Amplifying Deep Reasoning with Iterative Top-Down Feedback
por: Fein-Ashley, Jacob, et al.
Publicado: (2024)
por: Fein-Ashley, Jacob, et al.
Publicado: (2024)
Equilibrium Matching: Generative Modeling with Implicit Energy-Based Models
por: Wang, Runqian, et al.
Publicado: (2025)
por: Wang, Runqian, et al.
Publicado: (2025)
Stability and Generalization in Looped Transformers
por: Labovich, Asher
Publicado: (2026)
por: Labovich, Asher
Publicado: (2026)
On Vanishing Variance in Transformer Length Generalization
por: Li, Ruining, et al.
Publicado: (2025)
por: Li, Ruining, et al.
Publicado: (2025)
Predictive Pipelined Decoding: A Compute-Latency Trade-off for Exact LLM Decoding
por: Yang, Seongjun, et al.
Publicado: (2023)
por: Yang, Seongjun, et al.
Publicado: (2023)
Task Vectors in In-Context Learning: Emergence, Formation, and Benefit
por: Yang, Liu, et al.
Publicado: (2025)
por: Yang, Liu, et al.
Publicado: (2025)
Arithmetic Transformers Can Length-Generalize in Both Operand Length and Count
por: Cho, Hanseul, et al.
Publicado: (2024)
por: Cho, Hanseul, et al.
Publicado: (2024)
From Markov to Laplace: How Mamba In-Context Learns Markov Chains
por: Bondaschi, Marco, et al.
Publicado: (2025)
por: Bondaschi, Marco, et al.
Publicado: (2025)
Compositional Generative Modeling: A Single Model is Not All You Need
por: Du, Yilun, et al.
Publicado: (2024)
por: Du, Yilun, et al.
Publicado: (2024)
Infected Smallville: How Disease Threat Shapes Sociality in LLM Agents
por: Choi, Soyeon, et al.
Publicado: (2025)
por: Choi, Soyeon, et al.
Publicado: (2025)
SPEX: Scaling Feature Interaction Explanations for LLMs
por: Kang, Justin Singh, et al.
Publicado: (2025)
por: Kang, Justin Singh, et al.
Publicado: (2025)
Ejemplares similares
-
Optimizing DDPM Sampling with Shortcut Fine-Tuning
por: Fan, Ying, et al.
Publicado: (2023) -
Self-Improving Transformers Overcome Easy-to-Hard and Length Generalization Challenges
por: Lee, Nayoung, et al.
Publicado: (2025) -
Looped Transformers are Better at Learning Learning Algorithms
por: Yang, Liu, et al.
Publicado: (2023) -
Adaptive Sparse Möbius Transforms for Learning Polynomials
por: Erginbas, Yigit Efe, et al.
Publicado: (2026) -
Toward a Theory of Tokenization in LLMs
por: Rajaraman, Nived, et al.
Publicado: (2024)