Deep sequence models tend to memorize geometrically; it is unclear why
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Noroozizadeh, Shahriar, Nagarajan, Vaishnavh, Rosenfeld, Elan, Kumar, Sanjiv |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The pitfalls of next-token prediction
par: Bachmann, Gregor, et autres
Publié: (2024)
par: Bachmann, Gregor, et autres
Publié: (2024)
Think before you speak: Training Language Models With Pause Tokens
par: Goyal, Sachin, et autres
Publié: (2023)
par: Goyal, Sachin, et autres
Publié: (2023)
Reconstructing Sepsis Trajectories from Clinical Case Reports using LLMs: the Textual Time Series Corpus for Sepsis
par: Noroozizadeh, Shahriar, et autres
Publié: (2025)
par: Noroozizadeh, Shahriar, et autres
Publié: (2025)
TLDR at SemEval-2024 Task 2: T5-generated clinical-Language summaries for DeBERTa Report Analysis
par: Das, Spandan, et autres
Publié: (2024)
par: Das, Spandan, et autres
Publié: (2024)
Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment
par: Kumar, Sayantan, et autres
Publié: (2026)
par: Kumar, Sayantan, et autres
Publié: (2026)
PMOA-TTS: Introducing the PubMed Open Access Textual Times Series Corpus
par: Noroozizadeh, Shahriar, et autres
Publié: (2025)
par: Noroozizadeh, Shahriar, et autres
Publié: (2025)
Roll the dice & look before you leap: Going beyond the creative limits of next-token prediction
par: Nagarajan, Vaishnavh, et autres
Publié: (2025)
par: Nagarajan, Vaishnavh, et autres
Publié: (2025)
On student-teacher deviations in distillation: does it pay to disobey?
par: Nagarajan, Vaishnavh, et autres
Publié: (2023)
par: Nagarajan, Vaishnavh, et autres
Publié: (2023)
World Properties without World Models: Recovering Spatial and Temporal Structure from Co-occurrence Statistics in Static Word Embeddings
par: Barenholtz, Elan
Publié: (2026)
par: Barenholtz, Elan
Publié: (2026)
Forecasting Clinical Risk from Textual Time Series: Structuring Narratives for Temporal AI in Healthcare
par: Noroozizadeh, Shahriar, et autres
Publié: (2025)
par: Noroozizadeh, Shahriar, et autres
Publié: (2025)
ET tu, CLIP? Addressing Common Object Errors for Unseen Environments
par: Byun, Ye Won, et autres
Publié: (2024)
par: Byun, Ye Won, et autres
Publié: (2024)
Reasoning with Latent Thoughts: On the Power of Looped Transformers
par: Saunshi, Nikunj, et autres
Publié: (2025)
par: Saunshi, Nikunj, et autres
Publié: (2025)
Temporal Supervised Contrastive Learning for Modeling Patient Risk Progression
par: Noroozizadeh, Shahriar, et autres
Publié: (2023)
par: Noroozizadeh, Shahriar, et autres
Publié: (2023)
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
par: Golchin, Shahriar, et autres
Publié: (2023)
par: Golchin, Shahriar, et autres
Publié: (2023)
On the Inductive Bias of Stacking Towards Improving Reasoning
par: Saunshi, Nikunj, et autres
Publié: (2024)
par: Saunshi, Nikunj, et autres
Publié: (2024)
Exploring and Improving Drafts in Blockwise Parallel Decoding
par: Kim, Taehyeon, et autres
Publié: (2024)
par: Kim, Taehyeon, et autres
Publié: (2024)
HU at SemEval-2024 Task 8A: Can Contrastive Learning Learn Embeddings to Detect Machine-Generated Text?
par: Dipta, Shubhashis Roy, et autres
Publié: (2024)
par: Dipta, Shubhashis Roy, et autres
Publié: (2024)
Language Model Cascades: Token-level uncertainty and beyond
par: Gupta, Neha, et autres
Publié: (2024)
par: Gupta, Neha, et autres
Publié: (2024)
Faster Cascades via Speculative Decoding
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?
par: Nunez, Jeanmely Rojas, et autres
Publié: (2026)
par: Nunez, Jeanmely Rojas, et autres
Publié: (2026)
Revisiting the Effectiveness of LLM Pruning for Test-Time Scaling
par: Monjur, Ocean, et autres
Publié: (2026)
par: Monjur, Ocean, et autres
Publié: (2026)
The Impact of Medication Non-adherence on Adverse Outcomes: Evidence from Schizophrenia Patients via Survival Analysis
par: Noroozizadeh, Shahriar, et autres
Publié: (2025)
par: Noroozizadeh, Shahriar, et autres
Publié: (2025)
SurvHTE-Bench: A Benchmark for Heterogeneous Treatment Effect Estimation in Survival Analysis
par: Noroozizadeh, Shahriar, et autres
Publié: (2026)
par: Noroozizadeh, Shahriar, et autres
Publié: (2026)
LoRA Done RITE: Robust Invariant Transformation Equilibration for LoRA Optimization
par: Yen, Jui-Nan, et autres
Publié: (2024)
par: Yen, Jui-Nan, et autres
Publié: (2024)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
par: Zhou, Yongchao, et autres
Publié: (2023)
par: Zhou, Yongchao, et autres
Publié: (2023)
Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models
par: Nahin, Shahriar Kabir, et autres
Publié: (2025)
par: Nahin, Shahriar Kabir, et autres
Publié: (2025)
Time Travel in LLMs: Tracing Data Contamination in Large Language Models
par: Golchin, Shahriar, et autres
Publié: (2023)
par: Golchin, Shahriar, et autres
Publié: (2023)
Intent Laundering: AI Safety Datasets Are Not What They Seem
par: Golchin, Shahriar, et autres
Publié: (2026)
par: Golchin, Shahriar, et autres
Publié: (2026)
Memorization in In-Context Learning
par: Golchin, Shahriar, et autres
Publié: (2024)
par: Golchin, Shahriar, et autres
Publié: (2024)
Catch Your Breath: Adaptive Computation for Self-Paced Sequence Production
par: Galashov, Alexandre, et autres
Publié: (2025)
par: Galashov, Alexandre, et autres
Publié: (2025)
What are you sinking? A geometric approach on attention sink
par: Ruscio, Valeria, et autres
Publié: (2025)
par: Ruscio, Valeria, et autres
Publié: (2025)
Task Facet Learning: A Structured Approach to Prompt Optimization
par: Juneja, Gurusha, et autres
Publié: (2024)
par: Juneja, Gurusha, et autres
Publié: (2024)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
par: Gupta, Taneesh, et autres
Publié: (2024)
par: Gupta, Taneesh, et autres
Publié: (2024)
DLBacktrace: A Model Agnostic Explainability for any Deep Learning Models
par: Sankarapu, Vinay Kumar, et autres
Publié: (2024)
par: Sankarapu, Vinay Kumar, et autres
Publié: (2024)
Identifying Representations for Intervention Extrapolation
par: Saengkyongam, Sorawit, et autres
Publié: (2023)
par: Saengkyongam, Sorawit, et autres
Publié: (2023)
MultiSoc-4D: A Benchmark for Diagnosing Instruction-Induced Label Collapse in Closed-Set LLM Annotation of Bengali Social Media
par: Pramanik, Souvik, et autres
Publié: (2026)
par: Pramanik, Souvik, et autres
Publié: (2026)
One-Shot Strategic Classification Under Unknown Costs
par: Rosenfeld, Elan, et autres
Publié: (2023)
par: Rosenfeld, Elan, et autres
Publié: (2023)
PortLLM: Personalizing Evolving Large Language Models with Training-Free and Portable Model Patches
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2024)
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2024)
Deep learning and abstractive summarisation for radiological reports: an empirical study for adapting the PEGASUS models' family with scarce data
par: Benzoni, Claudio, et autres
Publié: (2025)
par: Benzoni, Claudio, et autres
Publié: (2025)
Learning under noisy supervision is governed by a feedback-truth gap
par: Schonfeld, Elan, et autres
Publié: (2026)
par: Schonfeld, Elan, et autres
Publié: (2026)
Documents similaires
-
The pitfalls of next-token prediction
par: Bachmann, Gregor, et autres
Publié: (2024) -
Think before you speak: Training Language Models With Pause Tokens
par: Goyal, Sachin, et autres
Publié: (2023) -
Reconstructing Sepsis Trajectories from Clinical Case Reports using LLMs: the Textual Time Series Corpus for Sepsis
par: Noroozizadeh, Shahriar, et autres
Publié: (2025) -
TLDR at SemEval-2024 Task 2: T5-generated clinical-Language summaries for DeBERTa Report Analysis
par: Das, Spandan, et autres
Publié: (2024) -
Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment
par: Kumar, Sayantan, et autres
Publié: (2026)