Specialised or Generic? Tokenization Choices for Radiology Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Warr, Hermione, Xu, Wentian, Anthony, Harry, Ibrahim, Yasin, McGowan, Daniel, Kamnitsas, Konstantinos |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Quality Control for Radiology Report Generation Models via Auxiliary Auditing Components
by: Warr, Hermione, et al.
Published: (2024)
by: Warr, Hermione, et al.
Published: (2024)
Semi-Supervised Learning for Deep Causal Generative Models
by: Ibrahim, Yasin, et al.
Published: (2024)
by: Ibrahim, Yasin, et al.
Published: (2024)
The Invisible Gorilla Effect in Out-of-distribution Detection
by: Anthony, Harry, et al.
Published: (2026)
by: Anthony, Harry, et al.
Published: (2026)
Examining Modality Incongruity in Multimodal Federated Learning for Medical Vision and Language-based Disease Detection
by: Saha, Pramit, et al.
Published: (2024)
by: Saha, Pramit, et al.
Published: (2024)
Comparing Specialised Small and General Large Language Models on Text Classification: 100 Labelled Samples to Achieve Break-Even Performance
by: Pecher, Branislav, et al.
Published: (2024)
by: Pecher, Branislav, et al.
Published: (2024)
Specialising and Analysing Instruction-Tuned and Byte-Level Language Models for Organic Reaction Prediction
by: Pang, Jiayun, et al.
Published: (2024)
by: Pang, Jiayun, et al.
Published: (2024)
Modality-Agnostic Input Channels Enable Segmentation of Brain lesions in Multimodal MRI with Sequences Unavailable During Training
by: Addison, Anthony P., et al.
Published: (2025)
by: Addison, Anthony P., et al.
Published: (2025)
SERPENT-VLM : Self-Refining Radiology Report Generation Using Vision Language Models
by: Kapadnis, Manav Nitin, et al.
Published: (2024)
by: Kapadnis, Manav Nitin, et al.
Published: (2024)
Counterfactual Token Generation in Large Language Models
by: Chatzi, Ivi, et al.
Published: (2024)
by: Chatzi, Ivi, et al.
Published: (2024)
A Study on Large Language Models' Limitations in Multiple-Choice Question Answering
by: Khatun, Aisha, et al.
Published: (2024)
by: Khatun, Aisha, et al.
Published: (2024)
Evaluation of Large Language Models via Coupled Token Generation
by: Benz, Nina Corvelo, et al.
Published: (2025)
by: Benz, Nina Corvelo, et al.
Published: (2025)
Sparse Autoencoder Decomposition of Clinical Sequence Model Representations: Feature Complexity, Task Specialisation, and Mortality Prediction
by: Sainsbury, Chris, et al.
Published: (2026)
by: Sainsbury, Chris, et al.
Published: (2026)
Evaluating Reliability in Medical DNNs: A Critical Analysis of Feature and Confidence-Based OOD Detection
by: Anthony, Harry, et al.
Published: (2024)
by: Anthony, Harry, et al.
Published: (2024)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
by: Wang, Wentian, et al.
Published: (2024)
by: Wang, Wentian, et al.
Published: (2024)
RadAnnotate: Large Language Models for Efficient and Reliable Radiology Report Annotation
by: Shetty, Saisha Pradeep, et al.
Published: (2026)
by: Shetty, Saisha Pradeep, et al.
Published: (2026)
RadioRAG: Online Retrieval-augmented Generation for Radiology Question Answering
by: Arasteh, Soroosh Tayebi, et al.
Published: (2024)
by: Arasteh, Soroosh Tayebi, et al.
Published: (2024)
Memory Tokens: Large Language Models Can Generate Reversible Sentence Embeddings
by: Sastre, Ignacio, et al.
Published: (2025)
by: Sastre, Ignacio, et al.
Published: (2025)
Length-MAX Tokenizer for Language Models
by: Dong, Dong, et al.
Published: (2025)
by: Dong, Dong, et al.
Published: (2025)
Clinically Grounded Agent-based Report Evaluation: An Interpretable Metric for Radiology Report Generation
by: Dua, Radhika, et al.
Published: (2025)
by: Dua, Radhika, et al.
Published: (2025)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
by: Chandak, Nikhil, et al.
Published: (2025)
by: Chandak, Nikhil, et al.
Published: (2025)
Multiple Choice Learning of Low-Rank Adapters for Language Modeling
by: Letzelter, Victor, et al.
Published: (2025)
by: Letzelter, Victor, et al.
Published: (2025)
Extracting and Encoding: Leveraging Large Language Models and Medical Knowledge to Enhance Radiological Text Representation
by: Messina, Pablo, et al.
Published: (2024)
by: Messina, Pablo, et al.
Published: (2024)
Understanding and Mitigating Tokenization Bias in Language Models
by: Phan, Buu, et al.
Published: (2024)
by: Phan, Buu, et al.
Published: (2024)
Guiding Language Model Reasoning with Planning Tokens
by: Wang, Xinyi, et al.
Published: (2023)
by: Wang, Xinyi, et al.
Published: (2023)
Adapting Language Models via Token Translation
by: Feng, Zhili, et al.
Published: (2024)
by: Feng, Zhili, et al.
Published: (2024)
Radiology-GPT: A Large Language Model for Radiology
by: Liu, Zhengliang, et al.
Published: (2023)
by: Liu, Zhengliang, et al.
Published: (2023)
Generating Multiple-Choice Knowledge Questions with Interpretable Difficulty Estimation using Knowledge Graphs and Large Language Models
by: Şakiroğlu, Mehmet Can, et al.
Published: (2026)
by: Şakiroğlu, Mehmet Can, et al.
Published: (2026)
Generating Plausible Distractors for Multiple-Choice Questions via Student Choice Prediction
by: Lee, Yooseop, et al.
Published: (2025)
by: Lee, Yooseop, et al.
Published: (2025)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
by: Zhang, Songming, et al.
Published: (2025)
by: Zhang, Songming, et al.
Published: (2025)
xVal: A Continuous Numerical Tokenization for Scientific Language Models
by: Golkar, Siavash, et al.
Published: (2023)
by: Golkar, Siavash, et al.
Published: (2023)
Exploring Multilingual Large Language Models for Enhanced TNM classification of Radiology Report in lung cancer staging
by: Matsuo, Hidetoshi, et al.
Published: (2024)
by: Matsuo, Hidetoshi, et al.
Published: (2024)
Revisiting Graph-Tokenizing Large Language Models: A Systematic Evaluation of Graph Token Understanding
by: Zhang, Zhongjian, et al.
Published: (2026)
by: Zhang, Zhongjian, et al.
Published: (2026)
Compositional Steering of Large Language Models with Steering Tokens
by: Radevski, Gorjan, et al.
Published: (2026)
by: Radevski, Gorjan, et al.
Published: (2026)
Probabilistic Token Alignment for Large Language Model Fusion
by: Zeng, Runjia, et al.
Published: (2025)
by: Zeng, Runjia, et al.
Published: (2025)
Token-Efficient Leverage Learning in Large Language Models
by: Zeng, Yuanhao, et al.
Published: (2024)
by: Zeng, Yuanhao, et al.
Published: (2024)
Language Model Cascades: Token-level uncertainty and beyond
by: Gupta, Neha, et al.
Published: (2024)
by: Gupta, Neha, et al.
Published: (2024)
Simple Policy Gradients for Reasoning with Diffusion Language Models
by: Zhan, Anthony
Published: (2025)
by: Zhan, Anthony
Published: (2025)
TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
by: Zhang, Tunyu, et al.
Published: (2025)
by: Zhang, Tunyu, et al.
Published: (2025)
Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models
by: Susanto, Lucky, et al.
Published: (2026)
by: Susanto, Lucky, et al.
Published: (2026)
You Point, I Learn: Online Adaptation of Interactive Segmentation Models for Handling Distribution Shifts in Medical Imaging
by: Xu, Wentian, et al.
Published: (2025)
by: Xu, Wentian, et al.
Published: (2025)
Similar Items
-
Quality Control for Radiology Report Generation Models via Auxiliary Auditing Components
by: Warr, Hermione, et al.
Published: (2024) -
Semi-Supervised Learning for Deep Causal Generative Models
by: Ibrahim, Yasin, et al.
Published: (2024) -
The Invisible Gorilla Effect in Out-of-distribution Detection
by: Anthony, Harry, et al.
Published: (2026) -
Examining Modality Incongruity in Multimodal Federated Learning for Medical Vision and Language-based Disease Detection
by: Saha, Pramit, et al.
Published: (2024) -
Comparing Specialised Small and General Large Language Models on Text Classification: 100 Labelled Samples to Achieve Break-Even Performance
by: Pecher, Branislav, et al.
Published: (2024)