Saved in:
| Main Author: | Martínez, Héctor Javier Vázquez |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2603.26292 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Towards Unsupervised Speech Recognition at the Syllable-Level
by: Wang, Liming, et al.
Published: (2025)
by: Wang, Liming, et al.
Published: (2025)
Measuring Form and Function in Language Models
by: Martínez, Héctor Javier Vázquez, et al.
Published: (2026)
by: Martínez, Héctor Javier Vázquez, et al.
Published: (2026)
SyllableLM: Learning Coarse Semantic Units for Speech Language Models
by: Baade, Alan, et al.
Published: (2024)
by: Baade, Alan, et al.
Published: (2024)
Evaluating Neural Language Models as Cognitive Models of Language Acquisition
by: Martínez, Héctor Javier Vázquez, et al.
Published: (2023)
by: Martínez, Héctor Javier Vázquez, et al.
Published: (2023)
Song Form-aware Full-Song Text-to-Lyrics Generation with Multi-Level Granularity Syllable Count Control
by: Chae, Yunkee, et al.
Published: (2024)
by: Chae, Yunkee, et al.
Published: (2024)
Is There a Case for Conversation Optimized Tokenizers in Large Language Models?
by: Ferrando, Raquel, et al.
Published: (2025)
by: Ferrando, Raquel, et al.
Published: (2025)
Syllable-level lyrics generation from melody exploiting character-level language model
by: Zhang, Zhe, et al.
Published: (2023)
by: Zhang, Zhe, et al.
Published: (2023)
TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
by: Yang, Zhen, et al.
Published: (2023)
by: Yang, Zhen, et al.
Published: (2023)
Incorporating Error Level Noise Embedding for Improving LLM-Assisted Robustness in Persian Speech Recognition
by: Rahmani, Zahra, et al.
Published: (2025)
by: Rahmani, Zahra, et al.
Published: (2025)
Token-Level Uncertainty-Aware Objective for Language Model Post-Training
by: Liu, Tingkai, et al.
Published: (2025)
by: Liu, Tingkai, et al.
Published: (2025)
Do We Need Distinct Representations for Every Speech Token? Unveiling and Exploiting Redundancy in Large Speech Language Models
by: Xiang, Bajian, et al.
Published: (2026)
by: Xiang, Bajian, et al.
Published: (2026)
AI Steerability 360: A Toolkit for Steering Large Language Models
by: Miehling, Erik, et al.
Published: (2026)
by: Miehling, Erik, et al.
Published: (2026)
Citekit: A Modular Toolkit for Large Language Model Citation Generation
by: Shen, Jiajun, et al.
Published: (2024)
by: Shen, Jiajun, et al.
Published: (2024)
Do BERT Embeddings Encode Narrative Dimensions? A Token-Level Probing Analysis of Time, Space, Causality, and Character in Fiction
by: Bei, Beicheng, et al.
Published: (2026)
by: Bei, Beicheng, et al.
Published: (2026)
Compressing Sequences in the Latent Embedding Space: $K$-Token Merging for Large Language Models
by: Xu, Zihao, et al.
Published: (2026)
by: Xu, Zihao, et al.
Published: (2026)
WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language Models
by: Gupta, Prannaya, et al.
Published: (2024)
by: Gupta, Prannaya, et al.
Published: (2024)
General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
by: Shi, Bingkang, et al.
Published: (2023)
by: Shi, Bingkang, et al.
Published: (2023)
TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching
by: Nguyen, Truong, et al.
Published: (2026)
by: Nguyen, Truong, et al.
Published: (2026)
SinaTools: Open Source Toolkit for Arabic Natural Language Processing
by: Hammouda, Tymaa, et al.
Published: (2024)
by: Hammouda, Tymaa, et al.
Published: (2024)
EasyDistill: A Comprehensive Toolkit for Effective Knowledge Distillation of Large Language Models
by: Wang, Chengyu, et al.
Published: (2025)
by: Wang, Chengyu, et al.
Published: (2025)
VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model
by: Long, Zuwei, et al.
Published: (2025)
by: Long, Zuwei, et al.
Published: (2025)
Scalable Token-Level Hallucination Detection in Large Language Models
by: Min, Rui, et al.
Published: (2026)
by: Min, Rui, et al.
Published: (2026)
Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler
by: Shen, Yikang, et al.
Published: (2024)
by: Shen, Yikang, et al.
Published: (2024)
SuperPos-Prompt: Enhancing Soft Prompt Tuning of Language Models with Superposition of Multi Token Embeddings
by: SadraeiJavaeri, MohammadAli, et al.
Published: (2024)
by: SadraeiJavaeri, MohammadAli, et al.
Published: (2024)
Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding
by: Zhu, Yifan, et al.
Published: (2026)
by: Zhu, Yifan, et al.
Published: (2026)
Sketch: A Toolkit for Streamlining LLM Operations
by: Jiang, Xin, et al.
Published: (2024)
by: Jiang, Xin, et al.
Published: (2024)
Language-Agnostic Suicidal Risk Detection Using Large Language Models
by: Kim, June-Woo, et al.
Published: (2025)
by: Kim, June-Woo, et al.
Published: (2025)
Sticking to the Mean: Detecting Sticky Tokens in Text Embedding Models
by: Chen, Kexin, et al.
Published: (2025)
by: Chen, Kexin, et al.
Published: (2025)
Agnostic Language Identification and Generation
by: Høgsgaard, Mikael Møller, et al.
Published: (2026)
by: Høgsgaard, Mikael Møller, et al.
Published: (2026)
Memory Tokens: Large Language Models Can Generate Reversible Sentence Embeddings
by: Sastre, Ignacio, et al.
Published: (2025)
by: Sastre, Ignacio, et al.
Published: (2025)
SwiftEmbed: Ultra-Fast Text Embeddings via Static Token Lookup for Real-Time Applications
by: Lansiaux, Edouard, et al.
Published: (2025)
by: Lansiaux, Edouard, et al.
Published: (2025)
TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models
by: Choo, Jinho, et al.
Published: (2026)
by: Choo, Jinho, et al.
Published: (2026)
KL3M Tokenizers: A Family of Domain-Specific and Character-Level Tokenizers for Legal, Financial, and Preprocessing Applications
by: Bommarito, Michael J, et al.
Published: (2025)
by: Bommarito, Michael J, et al.
Published: (2025)
Speed and Conversational Large Language Models: Not All Is About Tokens per Second
by: Conde, Javier, et al.
Published: (2025)
by: Conde, Javier, et al.
Published: (2025)
An Automatic Question Usability Evaluation Toolkit
by: Moore, Steven, et al.
Published: (2024)
by: Moore, Steven, et al.
Published: (2024)
Feedback Forensics: A Toolkit to Measure AI Personality
by: Findeis, Arduin, et al.
Published: (2025)
by: Findeis, Arduin, et al.
Published: (2025)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
by: Tu, Shangqing, et al.
Published: (2024)
by: Tu, Shangqing, et al.
Published: (2024)
Arcee's MergeKit: A Toolkit for Merging Large Language Models
by: Goddard, Charles, et al.
Published: (2024)
by: Goddard, Charles, et al.
Published: (2024)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
by: Zhang, Xueyao, et al.
Published: (2025)
by: Zhang, Xueyao, et al.
Published: (2025)
Finish First, Perfect Later: Test-Time Token-Level Cross-Validation for Diffusion Large Language Models
by: Tian, Runchu, et al.
Published: (2025)
by: Tian, Runchu, et al.
Published: (2025)
Similar Items
-
Towards Unsupervised Speech Recognition at the Syllable-Level
by: Wang, Liming, et al.
Published: (2025) -
Measuring Form and Function in Language Models
by: Martínez, Héctor Javier Vázquez, et al.
Published: (2026) -
SyllableLM: Learning Coarse Semantic Units for Speech Language Models
by: Baade, Alan, et al.
Published: (2024) -
Evaluating Neural Language Models as Cognitive Models of Language Acquisition
by: Martínez, Héctor Javier Vázquez, et al.
Published: (2023) -
Song Form-aware Full-Song Text-to-Lyrics Generation with Multi-Level Granularity Syllable Count Control
by: Chae, Yunkee, et al.
Published: (2024)