FoNE: Precise Single-Token Number Embeddings via Fourier Features
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Tianyi, Fu, Deqing, Soltanolkotabi, Mahdi, Jia, Robin, Sharan, Vatsal |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pre-trained Large Language Models Use Fourier Features to Compute Addition
par: Zhou, Tianyi, et autres
Publié: (2024)
par: Zhou, Tianyi, et autres
Publié: (2024)
Convergent Evolution: How Different Language Models Learn Similar Number Representations
par: Fu, Deqing, et autres
Publié: (2026)
par: Fu, Deqing, et autres
Publié: (2026)
Transformers Learn to Achieve Second-Order Convergence Rates for In-Context Linear Regression
par: Fu, Deqing, et autres
Publié: (2023)
par: Fu, Deqing, et autres
Publié: (2023)
Transformers Learn Low Sensitivity Functions: Investigations and Implications
par: Vasudeva, Bhavya, et autres
Publié: (2024)
par: Vasudeva, Bhavya, et autres
Publié: (2024)
Transformers Provably Learn Algorithmic Solutions for Graph Connectivity, But Only with the Right Data
par: Ye, Qilin, et autres
Publié: (2025)
par: Ye, Qilin, et autres
Publié: (2025)
Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
par: Gan, Woody Haosheng, et autres
Publié: (2025)
par: Gan, Woody Haosheng, et autres
Publié: (2025)
The Rich and the Simple: On the Implicit Bias of Adam and SGD
par: Vasudeva, Bhavya, et autres
Publié: (2025)
par: Vasudeva, Bhavya, et autres
Publié: (2025)
Understanding Contextual Recall in Transformers: How Finetuning Enables In-Context Reasoning over Pretraining Knowledge
par: Vasudeva, Bhavya, et autres
Publié: (2026)
par: Vasudeva, Bhavya, et autres
Publié: (2026)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
par: Fu, Deqing, et autres
Publié: (2024)
par: Fu, Deqing, et autres
Publié: (2024)
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
par: Li, Ziyue, et autres
Publié: (2024)
par: Li, Ziyue, et autres
Publié: (2024)
Luna-2: Scalable Single-Token Evaluation with Small Language Models
par: Goel, Vatsal, et autres
Publié: (2026)
par: Goel, Vatsal, et autres
Publié: (2026)
Are LLM Decisions Faithful to Verbal Confidence?
par: Wang, Jiawei, et autres
Publié: (2026)
par: Wang, Jiawei, et autres
Publié: (2026)
Promote, Suppress, Iterate: How Language Models Answer One-to-Many Factual Queries
par: Yan, Tianyi Lorena, et autres
Publié: (2025)
par: Yan, Tianyi Lorena, et autres
Publié: (2025)
Latent Concept Disentanglement in Transformer-based Language Models
par: Hong, Guan Zhe, et autres
Publié: (2025)
par: Hong, Guan Zhe, et autres
Publié: (2025)
Token Distillation: Attention-aware Input Embeddings For New Tokens
par: Dobler, Konstantin, et autres
Publié: (2025)
par: Dobler, Konstantin, et autres
Publié: (2025)
Limitations on Accurate, Trusted, Human-level Reasoning
par: Panigrahy, Rina, et autres
Publié: (2025)
par: Panigrahy, Rina, et autres
Publié: (2025)
FoQA: A Faroese Question-Answering Dataset
par: Simonsen, Annika, et autres
Publié: (2025)
par: Simonsen, Annika, et autres
Publié: (2025)
Cramming 1568 Tokens into a Single Vector and Back Again: Exploring the Limits of Embedding Space Capacity
par: Kuratov, Yuri, et autres
Publié: (2025)
par: Kuratov, Yuri, et autres
Publié: (2025)
Measuring Intrinsic Dimension of Token Embeddings
par: Kataiwa, Takuya, et autres
Publié: (2025)
par: Kataiwa, Takuya, et autres
Publié: (2025)
Attention with Trained Embeddings Provably Selects Important Tokens
par: Wu, Diyuan, et autres
Publié: (2025)
par: Wu, Diyuan, et autres
Publié: (2025)
Ulterior Motives: Detecting Misaligned Reasoning in Continuous Thought Models
par: Ramjee, Sharan
Publié: (2026)
par: Ramjee, Sharan
Publié: (2026)
GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling
par: Dadgarnia, Alireza, et autres
Publié: (2026)
par: Dadgarnia, Alireza, et autres
Publié: (2026)
Can GPT Improve the State of Prior Authorization via Guideline Based Automated Question Answering?
par: Vatsal, Shubham, et autres
Publié: (2024)
par: Vatsal, Shubham, et autres
Publié: (2024)
EPSVec: Efficient and Private Synthetic Data Generation via Dataset Vectors
par: Banayeeanzade, Amin, et autres
Publié: (2026)
par: Banayeeanzade, Amin, et autres
Publié: (2026)
Can GPT Redefine Medical Understanding? Evaluating GPT on Biomedical Machine Reading Comprehension
par: Vatsal, Shubham, et autres
Publié: (2024)
par: Vatsal, Shubham, et autres
Publié: (2024)
Simultaneous Swap Regret Minimization via KL-Calibration
par: Luo, Haipeng, et autres
Publié: (2025)
par: Luo, Haipeng, et autres
Publié: (2025)
Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
par: Liu, Hanbing, et autres
Publié: (2025)
par: Liu, Hanbing, et autres
Publié: (2025)
Unsupervised Text Segmentation via Kernel Change-Point Detection on Sentence Embeddings
par: Jia, Mumin, et autres
Publié: (2026)
par: Jia, Mumin, et autres
Publié: (2026)
Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors
par: Rofin, Mark, et autres
Publié: (2026)
par: Rofin, Mark, et autres
Publié: (2026)
Hierarchical Token Prepending: Enhancing Information Flow in Decoder-based LLM Embeddings
par: Ding, Xueying, et autres
Publié: (2025)
par: Ding, Xueying, et autres
Publié: (2025)
DeLLMa: Decision Making Under Uncertainty with Large Language Models
par: Liu, Ollie, et autres
Publié: (2024)
par: Liu, Ollie, et autres
Publié: (2024)
Can Public LLMs be used for Self-Diagnosis of Medical Conditions ?
par: Balasubramanian, Nikil Sharan Prabahar, et autres
Publié: (2024)
par: Balasubramanian, Nikil Sharan Prabahar, et autres
Publié: (2024)
Verify with Caution: The Pitfalls of Relying on Imperfect Factuality Metrics
par: Godbole, Ameya, et autres
Publié: (2025)
par: Godbole, Ameya, et autres
Publié: (2025)
Language Model Training Paradigms for Clinical Feature Embeddings
par: Hu, Yurong, et autres
Publié: (2023)
par: Hu, Yurong, et autres
Publié: (2023)
Understanding Token Probability Encoding in Output Embeddings
par: Cho, Hakaze, et autres
Publié: (2024)
par: Cho, Hakaze, et autres
Publié: (2024)
Interchangeable Token Embeddings for Extendable Vocabulary and Alpha-Equivalence
par: Işık, İlker, et autres
Publié: (2024)
par: Işık, İlker, et autres
Publié: (2024)
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
par: Feng, Weitao, et autres
Publié: (2025)
par: Feng, Weitao, et autres
Publié: (2025)
Efficient Reinforcement Finetuning via Adaptive Curriculum Learning
par: Shi, Taiwei, et autres
Publié: (2025)
par: Shi, Taiwei, et autres
Publié: (2025)
T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings
par: Deiseroth, Björn, et autres
Publié: (2024)
par: Deiseroth, Björn, et autres
Publié: (2024)
Learning to Recall with Transformers Beyond Orthogonal Embeddings
par: Vural, Nuri Mert, et autres
Publié: (2026)
par: Vural, Nuri Mert, et autres
Publié: (2026)
Documents similaires
-
Pre-trained Large Language Models Use Fourier Features to Compute Addition
par: Zhou, Tianyi, et autres
Publié: (2024) -
Convergent Evolution: How Different Language Models Learn Similar Number Representations
par: Fu, Deqing, et autres
Publié: (2026) -
Transformers Learn to Achieve Second-Order Convergence Rates for In-Context Linear Regression
par: Fu, Deqing, et autres
Publié: (2023) -
Transformers Learn Low Sensitivity Functions: Investigations and Implications
par: Vasudeva, Bhavya, et autres
Publié: (2024) -
Transformers Provably Learn Algorithmic Solutions for Graph Connectivity, But Only with the Right Data
par: Ye, Qilin, et autres
Publié: (2025)