Text Generation Beyond Discrete Token Sampling
Fuente:
arXiv
Saved in:
| Main Authors: | Zhuang, Yufan, Liu, Liyuan, Singh, Chandan, Shang, Jingbo, Gao, Jianfeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Vector-ICL: In-context Learning with Continuous Vector Representations
by: Zhuang, Yufan, et al.
Published: (2024)
by: Zhuang, Yufan, et al.
Published: (2024)
Learning a Decision Tree Algorithm with Transformers
by: Zhuang, Yufan, et al.
Published: (2024)
by: Zhuang, Yufan, et al.
Published: (2024)
Test-time Recursive Thinking: Self-Improvement without External Feedback
by: Zhuang, Yufan, et al.
Published: (2026)
by: Zhuang, Yufan, et al.
Published: (2026)
Training Language Models to Generate Quality Code with Program Analysis Feedback
by: Yao, Feng, et al.
Published: (2025)
by: Yao, Feng, et al.
Published: (2025)
Data Contamination Can Cross Language Barriers
by: Yao, Feng, et al.
Published: (2024)
by: Yao, Feng, et al.
Published: (2024)
Model Tells Itself Where to Attend: Faithfulness Meets Automatic Attention Steering
by: Zhang, Qingru, et al.
Published: (2024)
by: Zhang, Qingru, et al.
Published: (2024)
Attribute Structuring Improves LLM-Based Evaluation of Clinical Text Summaries
by: Gero, Zelalem, et al.
Published: (2024)
by: Gero, Zelalem, et al.
Published: (2024)
Interpretable Next-token Prediction via the Generalized Induction Head
by: Kim, Eunji, et al.
Published: (2024)
by: Kim, Eunji, et al.
Published: (2024)
Self-Taught Agentic Long Context Understanding
by: Zhuang, Yufan, et al.
Published: (2025)
by: Zhuang, Yufan, et al.
Published: (2025)
Finish First, Perfect Later: Test-Time Token-Level Cross-Validation for Diffusion Large Language Models
by: Tian, Runchu, et al.
Published: (2025)
by: Tian, Runchu, et al.
Published: (2025)
Rethinking Interpretability in the Era of Large Language Models
by: Singh, Chandan, et al.
Published: (2024)
by: Singh, Chandan, et al.
Published: (2024)
Beyond Scaling: Predicting Patent Approval with Domain-specific Fine-grained Claim Dependency Graph
by: Gao, Xiaochen Kev, et al.
Published: (2024)
by: Gao, Xiaochen Kev, et al.
Published: (2024)
Next-Token Prediction Task Assumes Optimal Data Ordering for LLM Training in Proof Generation
by: An, Chenyang, et al.
Published: (2024)
by: An, Chenyang, et al.
Published: (2024)
Towards Consistent Natural-Language Explanations via Explanation-Consistency Finetuning
by: Chen, Yanda, et al.
Published: (2024)
by: Chen, Yanda, et al.
Published: (2024)
Explainability-Based Token Replacement on LLM-Generated Text
by: Mohammadi, Hadi, et al.
Published: (2025)
by: Mohammadi, Hadi, et al.
Published: (2025)
READ: Improving Relation Extraction from an ADversarial Perspective
by: Li, Dawei, et al.
Published: (2024)
by: Li, Dawei, et al.
Published: (2024)
Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey
by: Li, Jindong, et al.
Published: (2025)
by: Li, Jindong, et al.
Published: (2025)
Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models
by: Cho, Gyeongje, et al.
Published: (2025)
by: Cho, Gyeongje, et al.
Published: (2025)
Alternatives To Next Token Prediction In Text Generation -- A Survey
by: Wyatt, Charlie, et al.
Published: (2025)
by: Wyatt, Charlie, et al.
Published: (2025)
UniMoT: Unified Molecule-Text Language Model with Discrete Token Representation
by: Guo, Shuhan, et al.
Published: (2024)
by: Guo, Shuhan, et al.
Published: (2024)
Reinforcement Learning with Token-level Feedback for Controllable Text Generation
by: Li, Wendi, et al.
Published: (2024)
by: Li, Wendi, et al.
Published: (2024)
Beyond Random Sampling: Efficient Language Model Pretraining via Curriculum Learning
by: Zhang, Yang, et al.
Published: (2025)
by: Zhang, Yang, et al.
Published: (2025)
Parameterized Synthetic Text Generation with SimpleStories
by: Finke, Lennart, et al.
Published: (2025)
by: Finke, Lennart, et al.
Published: (2025)
Agentic-imodels: Evolving agentic interpretability tools via autoresearch
by: Singh, Chandan, et al.
Published: (2026)
by: Singh, Chandan, et al.
Published: (2026)
Targeted Remasking: Replacing Token Editing with Token-to-Mask Refinement in Discrete Diffusion Language Models
by: Yao, Lin
Published: (2026)
by: Yao, Lin
Published: (2026)
Do explanations generalize across large reasoning models?
by: Pal, Koyena, et al.
Published: (2026)
by: Pal, Koyena, et al.
Published: (2026)
Moving Beyond Next-Token Prediction: Transformers are Context-Sensitive Language Generators
by: Rhee, Phill Kyu
Published: (2025)
by: Rhee, Phill Kyu
Published: (2025)
PPTAgent: Generating and Evaluating Presentations Beyond Text-to-Slides
by: Zheng, Hao, et al.
Published: (2025)
by: Zheng, Hao, et al.
Published: (2025)
When is the consistent prediction likely to be a correct prediction?
by: Nguyen, Alex, et al.
Published: (2024)
by: Nguyen, Alex, et al.
Published: (2024)
Sticking to the Mean: Detecting Sticky Tokens in Text Embedding Models
by: Chen, Kexin, et al.
Published: (2025)
by: Chen, Kexin, et al.
Published: (2025)
Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training
by: Si, Jianfeng, et al.
Published: (2025)
by: Si, Jianfeng, et al.
Published: (2025)
PTD-SQL: Partitioning and Targeted Drilling with LLMs in Text-to-SQL
by: Luo, Ruilin, et al.
Published: (2024)
by: Luo, Ruilin, et al.
Published: (2024)
HeartLLM: Discretized ECG Tokenization for LLM-Based Diagnostic Reasoning
by: Yang, Jinning, et al.
Published: (2025)
by: Yang, Jinning, et al.
Published: (2025)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
by: Cao, Meng, et al.
Published: (2024)
by: Cao, Meng, et al.
Published: (2024)
Debug like a Human: A Large Language Model Debugger via Verifying Runtime Execution Step-by-step
by: Zhong, Li, et al.
Published: (2024)
by: Zhong, Li, et al.
Published: (2024)
Planning Beyond Text: Graph-based Reasoning for Complex Narrative Generation
by: Gu, Hanwen, et al.
Published: (2026)
by: Gu, Hanwen, et al.
Published: (2026)
ToBlend: Token-Level Blending With an Ensemble of LLMs to Attack AI-Generated Text Detection
by: Huang, Fan, et al.
Published: (2024)
by: Huang, Fan, et al.
Published: (2024)
Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation
by: He, Linda, et al.
Published: (2025)
by: He, Linda, et al.
Published: (2025)
Token Masking Improves Transformer-Based Text Classification
by: Xu, Xianglong, et al.
Published: (2025)
by: Xu, Xianglong, et al.
Published: (2025)
Training Text-to-Molecule Models with Context-Aware Tokenization
by: Kim, Seojin, et al.
Published: (2025)
by: Kim, Seojin, et al.
Published: (2025)
Similar Items
-
Vector-ICL: In-context Learning with Continuous Vector Representations
by: Zhuang, Yufan, et al.
Published: (2024) -
Learning a Decision Tree Algorithm with Transformers
by: Zhuang, Yufan, et al.
Published: (2024) -
Test-time Recursive Thinking: Self-Improvement without External Feedback
by: Zhuang, Yufan, et al.
Published: (2026) -
Training Language Models to Generate Quality Code with Program Analysis Feedback
by: Yao, Feng, et al.
Published: (2025) -
Data Contamination Can Cross Language Barriers
by: Yao, Feng, et al.
Published: (2024)