Luna-2: Scalable Single-Token Evaluation with Small Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Goel, Vatsal, Dsouza, Rishon, Ega, Nikhil, Rambatla, Amey Ramesh, Friel, Rob, Shao, Shuai, Sheth, Yash |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Luna: An Evaluation Foundation Model to Catch Language Model Hallucinations with High Accuracy and Low Cost
by: Belyi, Masha, et al.
Published: (2024)
by: Belyi, Masha, et al.
Published: (2024)
HIDE and Seek: Detecting Hallucinations in Language Models via Decoupled Representations
by: Chatterjee, Anwoy, et al.
Published: (2025)
by: Chatterjee, Anwoy, et al.
Published: (2025)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
by: Chandak, Nikhil, et al.
Published: (2025)
by: Chandak, Nikhil, et al.
Published: (2025)
Evaluating Language Model Context Windows: A "Working Memory" Test and Inference-time Correction
by: Dsouza, Amanda, et al.
Published: (2024)
by: Dsouza, Amanda, et al.
Published: (2024)
A Survey of Prompt Engineering Methods in Large Language Models for Different NLP Tasks
by: Vatsal, Shubham, et al.
Published: (2024)
by: Vatsal, Shubham, et al.
Published: (2024)
Probing the Limits of Stylistic Alignment in Vision-Language Models
by: Farajidizaji, Asma, et al.
Published: (2025)
by: Farajidizaji, Asma, et al.
Published: (2025)
PlotTwist: A Creative Plot Generation Framework with Small Language Models
by: Thorat, Abhinav, et al.
Published: (2026)
by: Thorat, Abhinav, et al.
Published: (2026)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
by: Saxena, Yash, et al.
Published: (2024)
by: Saxena, Yash, et al.
Published: (2024)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
by: Wang, Xunguang, et al.
Published: (2025)
by: Wang, Xunguang, et al.
Published: (2025)
Evaluating Concurrent Robustness of Language Models Across Diverse Challenge Sets
by: Gupta, Vatsal, et al.
Published: (2023)
by: Gupta, Vatsal, et al.
Published: (2023)
Scalable Token-Level Hallucination Detection in Large Language Models
by: Min, Rui, et al.
Published: (2026)
by: Min, Rui, et al.
Published: (2026)
RAGBench: Explainable Benchmark for Retrieval-Augmented Generation Systems
by: Friel, Robert, et al.
Published: (2024)
by: Friel, Robert, et al.
Published: (2024)
Can GPT Redefine Medical Understanding? Evaluating GPT on Biomedical Machine Reading Comprehension
by: Vatsal, Shubham, et al.
Published: (2024)
by: Vatsal, Shubham, et al.
Published: (2024)
Multilingual Prompt Engineering in Large Language Models: A Survey Across NLP Tasks
by: Vatsal, Shubham, et al.
Published: (2025)
by: Vatsal, Shubham, et al.
Published: (2025)
Enhancing Large Language Models for Mobility Analytics with Semantic Location Tokenization
by: Chen, Yile, et al.
Published: (2025)
by: Chen, Yile, et al.
Published: (2025)
Regional Tiny Stories: Using Small Models to Compare Language Learning and Tokenizer Performance
by: Patil, Nirvan, et al.
Published: (2025)
by: Patil, Nirvan, et al.
Published: (2025)
On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation
by: Hsu, Chan-Jan, et al.
Published: (2026)
by: Hsu, Chan-Jan, et al.
Published: (2026)
Token-Efficient Leverage Learning in Large Language Models
by: Zeng, Yuanhao, et al.
Published: (2024)
by: Zeng, Yuanhao, et al.
Published: (2024)
Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages
by: Tamang, S., et al.
Published: (2024)
by: Tamang, S., et al.
Published: (2024)
Still Not Quite There! Evaluating Large Language Models for Comorbid Mental Health Diagnosis
by: Hengle, Amey, et al.
Published: (2024)
by: Hengle, Amey, et al.
Published: (2024)
Curved Inference: Concern-Sensitive Geometry in Large Language Model Residual Streams
by: Manson, Rob
Published: (2025)
by: Manson, Rob
Published: (2025)
Generation, Evaluation, and Explanation of Novelists' Styles with Single-Token Prompts
by: Rezaei, Mosab, et al.
Published: (2025)
by: Rezaei, Mosab, et al.
Published: (2025)
Token Alignment via Character Matching for Subword Completion
by: Athiwaratkun, Ben, et al.
Published: (2024)
by: Athiwaratkun, Ben, et al.
Published: (2024)
Emotion Classification in Low and Moderate Resource Languages
by: Tafreshi, Shabnam, et al.
Published: (2024)
by: Tafreshi, Shabnam, et al.
Published: (2024)
Question Difficulty Ranking for Multiple-Choice Reading Comprehension
by: Raina, Vatsal, et al.
Published: (2024)
by: Raina, Vatsal, et al.
Published: (2024)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
by: Shao, Chenze, et al.
Published: (2024)
by: Shao, Chenze, et al.
Published: (2024)
Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution
by: Jin, Qiao, et al.
Published: (2026)
by: Jin, Qiao, et al.
Published: (2026)
Thinking Tokens for Language Modeling
by: Herel, David, et al.
Published: (2024)
by: Herel, David, et al.
Published: (2024)
Revisiting Graph-Tokenizing Large Language Models: A Systematic Evaluation of Graph Token Understanding
by: Zhang, Zhongjian, et al.
Published: (2026)
by: Zhang, Zhongjian, et al.
Published: (2026)
Evaluation of Large Language Models via Coupled Token Generation
by: Benz, Nina Corvelo, et al.
Published: (2025)
by: Benz, Nina Corvelo, et al.
Published: (2025)
On The Truthfulness of 'Surprisingly Likely' Responses of Large Language Models
by: Goel, Naman
Published: (2023)
by: Goel, Naman
Published: (2023)
TokenButler: Token Importance is Predictable
by: Akhauri, Yash, et al.
Published: (2025)
by: Akhauri, Yash, et al.
Published: (2025)
Robustness of Large Language Models to Perturbations in Text
by: Singh, Ayush, et al.
Published: (2024)
by: Singh, Ayush, et al.
Published: (2024)
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
by: Bi, Zhenyu, et al.
Published: (2025)
by: Bi, Zhenyu, et al.
Published: (2025)
Convergent Evolution: How Different Language Models Learn Similar Number Representations
by: Fu, Deqing, et al.
Published: (2026)
by: Fu, Deqing, et al.
Published: (2026)
Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate
by: Chern, Steffi, et al.
Published: (2024)
by: Chern, Steffi, et al.
Published: (2024)
ProtocolLLM: RTL Benchmark for SystemVerilog Generation of Communication Protocols
by: Sheth, Arnav, et al.
Published: (2025)
by: Sheth, Arnav, et al.
Published: (2025)
Tokenization Matters! Degrading Large Language Models through Challenging Their Tokenization
by: Wang, Dixuan, et al.
Published: (2024)
by: Wang, Dixuan, et al.
Published: (2024)
SmallToLarge (S2L): Scalable Data Selection for Fine-tuning Large Language Models by Summarizing Training Trajectories of Small Models
by: Yang, Yu, et al.
Published: (2024)
by: Yang, Yu, et al.
Published: (2024)
Accelerating Multilingual Language Model for Excessively Tokenized Languages
by: Hong, Jimin, et al.
Published: (2024)
by: Hong, Jimin, et al.
Published: (2024)
Similar Items
-
Luna: An Evaluation Foundation Model to Catch Language Model Hallucinations with High Accuracy and Low Cost
by: Belyi, Masha, et al.
Published: (2024) -
HIDE and Seek: Detecting Hallucinations in Language Models via Decoupled Representations
by: Chatterjee, Anwoy, et al.
Published: (2025) -
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
by: Chandak, Nikhil, et al.
Published: (2025) -
Evaluating Language Model Context Windows: A "Working Memory" Test and Inference-time Correction
by: Dsouza, Amanda, et al.
Published: (2024) -
A Survey of Prompt Engineering Methods in Large Language Models for Different NLP Tasks
by: Vatsal, Shubham, et al.
Published: (2024)