SubTokenTest: A Practical Benchmark for Real-World Sub-token Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Hou, Shuyang, Hu, Yi, Zhang, Muhan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Number Cookbook: Number Understanding of Language Models and How to Improve It
por: Yang, Haotong, et al.
Publicado: (2024)
por: Yang, Haotong, et al.
Publicado: (2024)
Empowering Character-level Text Infilling by Eliminating Sub-Tokens
por: Ren, Houxing, et al.
Publicado: (2024)
por: Ren, Houxing, et al.
Publicado: (2024)
LooGLE v2: Are LLMs Ready for Real World Long Dependency Challenges?
por: He, Ziyuan, et al.
Publicado: (2025)
por: He, Ziyuan, et al.
Publicado: (2025)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
por: Shi, Yuzhen, et al.
Publicado: (2026)
por: Shi, Yuzhen, et al.
Publicado: (2026)
Case-Based or Rule-Based: How Do Transformers Do the Math?
por: Hu, Yi, et al.
Publicado: (2024)
por: Hu, Yi, et al.
Publicado: (2024)
RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction
por: Bian, Haonan, et al.
Publicado: (2026)
por: Bian, Haonan, et al.
Publicado: (2026)
BRIDGE: Benchmarking Large Language Models for Understanding Real-world Clinical Practice Text
por: Wu, Jiageng, et al.
Publicado: (2025)
por: Wu, Jiageng, et al.
Publicado: (2025)
LooGLE: Can Long-Context Language Models Understand Long Contexts?
por: Li, Jiaqi, et al.
Publicado: (2023)
por: Li, Jiaqi, et al.
Publicado: (2023)
COMPACT: Common-token Optimized Model Pruning Across Channels and Tokens
por: Kwek, Eugene, et al.
Publicado: (2025)
por: Kwek, Eugene, et al.
Publicado: (2025)
DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain
por: Borkakoty, Hsuvas, et al.
Publicado: (2026)
por: Borkakoty, Hsuvas, et al.
Publicado: (2026)
ConsintBench: Evaluating Language Models on Real-World Consumer Intent Understanding
por: Li, Xiaozhe, et al.
Publicado: (2025)
por: Li, Xiaozhe, et al.
Publicado: (2025)
AOrchestra: Automating Sub-Agent Creation for Agentic Orchestration
por: Ruan, Jianhao, et al.
Publicado: (2026)
por: Ruan, Jianhao, et al.
Publicado: (2026)
Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty
por: Wu, Peilin, et al.
Publicado: (2025)
por: Wu, Peilin, et al.
Publicado: (2025)
D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
por: Chen, Sen, et al.
Publicado: (2025)
por: Chen, Sen, et al.
Publicado: (2025)
You only need 4 extra tokens: Synergistic Test-time Adaptation for LLMs
por: Xu, Yijie, et al.
Publicado: (2025)
por: Xu, Yijie, et al.
Publicado: (2025)
LIFT: Improving Long Context Understanding Through Long Input Fine-Tuning
por: Mao, Yansheng, et al.
Publicado: (2024)
por: Mao, Yansheng, et al.
Publicado: (2024)
AnomaLLMy -- Detecting anomalous tokens in black-box LLMs through low-confidence single-token predictions
por: Witold, Waligóra
Publicado: (2024)
por: Witold, Waligóra
Publicado: (2024)
Can Large Language Models Understand Real-World Complex Instructions?
por: He, Qianyu, et al.
Publicado: (2023)
por: He, Qianyu, et al.
Publicado: (2023)
MCPVerse: An Expansive, Real-World Benchmark for Agentic Tool Use
por: Lei, Fei, et al.
Publicado: (2025)
por: Lei, Fei, et al.
Publicado: (2025)
Sub-token ViT Embedding via Stochastic Resonance Transformers
por: Lao, Dong, et al.
Publicado: (2023)
por: Lao, Dong, et al.
Publicado: (2023)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
por: Yang, Shuo, et al.
Publicado: (2025)
por: Yang, Shuo, et al.
Publicado: (2025)
From Sub-Ability Diagnosis to Human-Aligned Generation: Bridging the Gap for Text Length Control via MARKERGEN
por: Yuan, Peiwen, et al.
Publicado: (2025)
por: Yuan, Peiwen, et al.
Publicado: (2025)
SRFUND: A Multi-Granularity Hierarchical Structure Reconstruction Benchmark in Form Understanding
por: Ma, Jiefeng, et al.
Publicado: (2024)
por: Ma, Jiefeng, et al.
Publicado: (2024)
RadReason: Radiology Report Evaluation Metric with Reasons and Sub-Scores
por: Li, Yingshu, et al.
Publicado: (2025)
por: Li, Yingshu, et al.
Publicado: (2025)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
por: Wu, Yao, et al.
Publicado: (2026)
por: Wu, Yao, et al.
Publicado: (2026)
RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios
por: Zhou, Ruiwen, et al.
Publicado: (2024)
por: Zhou, Ruiwen, et al.
Publicado: (2024)
$τ$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
por: Yao, Shunyu, et al.
Publicado: (2024)
por: Yao, Shunyu, et al.
Publicado: (2024)
TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
por: Wei, Shaohang, et al.
Publicado: (2025)
por: Wei, Shaohang, et al.
Publicado: (2025)
WikiContradict: A Benchmark for Evaluating LLMs on Real-World Knowledge Conflicts from Wikipedia
por: Hou, Yufang, et al.
Publicado: (2024)
por: Hou, Yufang, et al.
Publicado: (2024)
From Words to Worlds: Benchmarking Cross-Cultural Cultural Understanding in Machine Translation
por: Han, Bangju, et al.
Publicado: (2026)
por: Han, Bangju, et al.
Publicado: (2026)
Jacobian Scopes: token-level causal attributions in LLMs
por: Liu, Toni J. B., et al.
Publicado: (2026)
por: Liu, Toni J. B., et al.
Publicado: (2026)
Prediction hubs are context-informed frequent tokens in LLMs
por: Nielsen, Beatrix M. G., et al.
Publicado: (2025)
por: Nielsen, Beatrix M. G., et al.
Publicado: (2025)
CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge
por: Ismayilzada, Mete, et al.
Publicado: (2026)
por: Ismayilzada, Mete, et al.
Publicado: (2026)
DetectRL: Benchmarking LLM-Generated Text Detection in Real-World Scenarios
por: Wu, Junchao, et al.
Publicado: (2024)
por: Wu, Junchao, et al.
Publicado: (2024)
Beyond SELECT: A Comprehensive Taxonomy-Guided Benchmark for Real-World Text-to-SQL Translation
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability
por: Xiao, Zikai, et al.
Publicado: (2025)
por: Xiao, Zikai, et al.
Publicado: (2025)
HalluMix: A Task-Agnostic, Multi-Domain Benchmark for Real-World Hallucination Detection
por: Emery, Deanna, et al.
Publicado: (2025)
por: Emery, Deanna, et al.
Publicado: (2025)
LLM driven Text-to-Table Generation through Sub-Tasks Guidance and Iterative Refinement
por: C, Rajmohan, et al.
Publicado: (2025)
por: C, Rajmohan, et al.
Publicado: (2025)
GenKnowSub: Improving Modularity and Reusability of LLMs through General Knowledge Subtraction
por: Bagherifard, Mohammadtaha, et al.
Publicado: (2025)
por: Bagherifard, Mohammadtaha, et al.
Publicado: (2025)
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
por: Liu, Dong, et al.
Publicado: (2025)
por: Liu, Dong, et al.
Publicado: (2025)
Ejemplares similares
-
Number Cookbook: Number Understanding of Language Models and How to Improve It
por: Yang, Haotong, et al.
Publicado: (2024) -
Empowering Character-level Text Infilling by Eliminating Sub-Tokens
por: Ren, Houxing, et al.
Publicado: (2024) -
LooGLE v2: Are LLMs Ready for Real World Long Dependency Challenges?
por: He, Ziyuan, et al.
Publicado: (2025) -
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
por: Shi, Yuzhen, et al.
Publicado: (2026) -
Case-Based or Rule-Based: How Do Transformers Do the Math?
por: Hu, Yi, et al.
Publicado: (2024)