Non-Zipfian Distribution of Stopwords and Subset Selection Models
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Wentian, Fontanelli, Oscar |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Quadratic Term Correction on Heaps' Law
by: Fontanelli, Oscar, et al.
Published: (2025)
by: Fontanelli, Oscar, et al.
Published: (2025)
Zipfian Whitening
by: Yokoi, Sho, et al.
Published: (2024)
by: Yokoi, Sho, et al.
Published: (2024)
Modeling Two-Scale Rank Distributions via Redistribution Dynamics or an Analytic Derivation of the Beta Rank Function
by: Fontanelli, Oscar, et al.
Published: (2026)
by: Fontanelli, Oscar, et al.
Published: (2026)
Text Categorization Can Enhance Domain-Agnostic Stopword Extraction
by: Turki, Houcemeddine, et al.
Published: (2024)
by: Turki, Houcemeddine, et al.
Published: (2024)
Curating Stopwords in Marathi: A TF-IDF Approach for Improved Text Analysis and Information Retrieval
by: Chavan, Rohan, et al.
Published: (2024)
by: Chavan, Rohan, et al.
Published: (2024)
Latent Terms: Dense Retrievers Contain Trivially Extractable BM25-ready Zipfian Vocabularies
by: Clavié, Benjamin, et al.
Published: (2026)
by: Clavié, Benjamin, et al.
Published: (2026)
Submodular Evaluation Subset Selection in Automatic Prompt Optimization
by: Nian, Jinming, et al.
Published: (2026)
by: Nian, Jinming, et al.
Published: (2026)
Diversity Measurement and Subset Selection for Instruction Tuning Datasets
by: Wang, Peiqi, et al.
Published: (2024)
by: Wang, Peiqi, et al.
Published: (2024)
Visual Exploration of Stopword Probabilities in Topic Models
by: Xue, Shuangjiang, et al.
Published: (2025)
by: Xue, Shuangjiang, et al.
Published: (2025)
DUMP: Automated Distribution-Level Curriculum Learning for RL-based LLM Post-training
by: Wang, Zhenting, et al.
Published: (2025)
by: Wang, Zhenting, et al.
Published: (2025)
InsBank: Evolving Instruction Subset for Ongoing Alignment
by: Shi, Jiayi, et al.
Published: (2025)
by: Shi, Jiayi, et al.
Published: (2025)
Reviving Any-Subset Autoregressive Models with Principled Parallel Sampling and Speculative Decoding
by: Guo, Gabe, et al.
Published: (2025)
by: Guo, Gabe, et al.
Published: (2025)
Developing a Modular Compiler for a Subset of a C-like Language
by: Dutta, Debasish, et al.
Published: (2025)
by: Dutta, Debasish, et al.
Published: (2025)
Dynamic Subset Tuning: Expanding the Operational Range of Parameter-Efficient Training for Large Language Models
by: Stahlberg, Felix, et al.
Published: (2024)
by: Stahlberg, Felix, et al.
Published: (2024)
SOI Matters: Analyzing Multi-Setting Training Dynamics in Pretrained Language Models via Subsets of Interest
by: Vassef, Shayan, et al.
Published: (2025)
by: Vassef, Shayan, et al.
Published: (2025)
Goanna: Resolving Haskell Type Errors With Minimal Correction Subsets
by: Fu, Shuai, et al.
Published: (2024)
by: Fu, Shuai, et al.
Published: (2024)
CalibraEval: Calibrating Prediction Distribution to Mitigate Selection Bias in LLMs-as-Judges
by: Li, Haitao, et al.
Published: (2024)
by: Li, Haitao, et al.
Published: (2024)
DiSRouter: Distributed Self-Routing for LLM Selections
by: Zheng, Hang, et al.
Published: (2025)
by: Zheng, Hang, et al.
Published: (2025)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
by: Wang, Wentian, et al.
Published: (2024)
by: Wang, Wentian, et al.
Published: (2024)
Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach
by: Deng, Shijian, et al.
Published: (2024)
by: Deng, Shijian, et al.
Published: (2024)
Specialised or Generic? Tokenization Choices for Radiology Language Models
by: Warr, Hermione, et al.
Published: (2025)
by: Warr, Hermione, et al.
Published: (2025)
Entropy-Based Data Selection for Language Models
by: Li, Hongming, et al.
Published: (2026)
by: Li, Hongming, et al.
Published: (2026)
Generative Sign-description Prompts with Multi-positive Contrastive Learning for Sign Language Recognition
by: Liang, Siyu, et al.
Published: (2025)
by: Liang, Siyu, et al.
Published: (2025)
SLoW: Select Low-frequency Words! Automatic Dictionary Selection for Translation on Large Language Models
by: Lu, Hongyuan, et al.
Published: (2025)
by: Lu, Hongyuan, et al.
Published: (2025)
Efficiently Identifying Low-Quality Language Subsets in Multilingual Datasets: A Case Study on a Large-Scale Multilingual Audio Dataset
by: Samir, Farhan, et al.
Published: (2024)
by: Samir, Farhan, et al.
Published: (2024)
Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference
by: Yuan, Jiayi, et al.
Published: (2025)
by: Yuan, Jiayi, et al.
Published: (2025)
Overcoming Copyright Barriers in Corpus Distribution Through Non-Reversible Hashing
by: Amalvy, Arthur, et al.
Published: (2026)
by: Amalvy, Arthur, et al.
Published: (2026)
Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation
by: Zhang, Ruiqi, et al.
Published: (2026)
by: Zhang, Ruiqi, et al.
Published: (2026)
Rethinking Residual Distribution in Locate-then-Edit Model Editing
by: Li, Xiaopeng, et al.
Published: (2025)
by: Li, Xiaopeng, et al.
Published: (2025)
Data Selection via Optimal Control for Language Models
by: Gu, Yuxian, et al.
Published: (2024)
by: Gu, Yuxian, et al.
Published: (2024)
Do not be greedy, Think Twice: Sampling and Selection for Document-level Information Extraction
by: Zubillaga, Mikel, et al.
Published: (2026)
by: Zubillaga, Mikel, et al.
Published: (2026)
Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection
by: Lyu, Weijie, et al.
Published: (2025)
by: Lyu, Weijie, et al.
Published: (2025)
Learning to Write Rationally: How Information Is Distributed in Non-Native Speakers' Essays
by: Tang, Zixin, et al.
Published: (2024)
by: Tang, Zixin, et al.
Published: (2024)
RAISE: Reinforced Adaptive Instruction Selection For Large Language Models
by: Lv, Qingsong, et al.
Published: (2025)
by: Lv, Qingsong, et al.
Published: (2025)
A Survey on Out-of-Distribution Evaluation of Neural NLP Models
by: Li, Xinzhe, et al.
Published: (2023)
by: Li, Xinzhe, et al.
Published: (2023)
SeTAR: Out-of-Distribution Detection with Selective Low-Rank Approximation
by: Li, Yixia, et al.
Published: (2024)
by: Li, Yixia, et al.
Published: (2024)
Leveraging Reasoning Model Answers to Enhance Non-Reasoning Model Capability
by: Wang, Haotian, et al.
Published: (2025)
by: Wang, Haotian, et al.
Published: (2025)
SelectLLM: Query-Aware Efficient Selection Algorithm for Large Language Models
by: Maurya, Kaushal Kumar, et al.
Published: (2024)
by: Maurya, Kaushal Kumar, et al.
Published: (2024)
Why Not Transform Chat Large Language Models to Non-English?
by: Geng, Xiang, et al.
Published: (2024)
by: Geng, Xiang, et al.
Published: (2024)
Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
by: Ruan, Zhiwen, et al.
Published: (2025)
by: Ruan, Zhiwen, et al.
Published: (2025)
Similar Items
-
Quadratic Term Correction on Heaps' Law
by: Fontanelli, Oscar, et al.
Published: (2025) -
Zipfian Whitening
by: Yokoi, Sho, et al.
Published: (2024) -
Modeling Two-Scale Rank Distributions via Redistribution Dynamics or an Analytic Derivation of the Beta Rank Function
by: Fontanelli, Oscar, et al.
Published: (2026) -
Text Categorization Can Enhance Domain-Agnostic Stopword Extraction
by: Turki, Houcemeddine, et al.
Published: (2024) -
Curating Stopwords in Marathi: A TF-IDF Approach for Improved Text Analysis and Information Retrieval
by: Chavan, Rohan, et al.
Published: (2024)