Luna-2: Scalable Single-Token Evaluation with Small Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Goel, Vatsal, Dsouza, Rishon, Ega, Nikhil, Rambatla, Amey Ramesh, Friel, Rob, Shao, Shuai, Sheth, Yash |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Luna: An Evaluation Foundation Model to Catch Language Model Hallucinations with High Accuracy and Low Cost
von: Belyi, Masha, et al.
Veröffentlicht: (2024)
von: Belyi, Masha, et al.
Veröffentlicht: (2024)
HIDE and Seek: Detecting Hallucinations in Language Models via Decoupled Representations
von: Chatterjee, Anwoy, et al.
Veröffentlicht: (2025)
von: Chatterjee, Anwoy, et al.
Veröffentlicht: (2025)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
von: Chandak, Nikhil, et al.
Veröffentlicht: (2025)
von: Chandak, Nikhil, et al.
Veröffentlicht: (2025)
Evaluating Language Model Context Windows: A "Working Memory" Test and Inference-time Correction
von: Dsouza, Amanda, et al.
Veröffentlicht: (2024)
von: Dsouza, Amanda, et al.
Veröffentlicht: (2024)
A Survey of Prompt Engineering Methods in Large Language Models for Different NLP Tasks
von: Vatsal, Shubham, et al.
Veröffentlicht: (2024)
von: Vatsal, Shubham, et al.
Veröffentlicht: (2024)
Probing the Limits of Stylistic Alignment in Vision-Language Models
von: Farajidizaji, Asma, et al.
Veröffentlicht: (2025)
von: Farajidizaji, Asma, et al.
Veröffentlicht: (2025)
PlotTwist: A Creative Plot Generation Framework with Small Language Models
von: Thorat, Abhinav, et al.
Veröffentlicht: (2026)
von: Thorat, Abhinav, et al.
Veröffentlicht: (2026)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
von: Saxena, Yash, et al.
Veröffentlicht: (2024)
von: Saxena, Yash, et al.
Veröffentlicht: (2024)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
Evaluating Concurrent Robustness of Language Models Across Diverse Challenge Sets
von: Gupta, Vatsal, et al.
Veröffentlicht: (2023)
von: Gupta, Vatsal, et al.
Veröffentlicht: (2023)
Scalable Token-Level Hallucination Detection in Large Language Models
von: Min, Rui, et al.
Veröffentlicht: (2026)
von: Min, Rui, et al.
Veröffentlicht: (2026)
RAGBench: Explainable Benchmark for Retrieval-Augmented Generation Systems
von: Friel, Robert, et al.
Veröffentlicht: (2024)
von: Friel, Robert, et al.
Veröffentlicht: (2024)
Can GPT Redefine Medical Understanding? Evaluating GPT on Biomedical Machine Reading Comprehension
von: Vatsal, Shubham, et al.
Veröffentlicht: (2024)
von: Vatsal, Shubham, et al.
Veröffentlicht: (2024)
Multilingual Prompt Engineering in Large Language Models: A Survey Across NLP Tasks
von: Vatsal, Shubham, et al.
Veröffentlicht: (2025)
von: Vatsal, Shubham, et al.
Veröffentlicht: (2025)
Enhancing Large Language Models for Mobility Analytics with Semantic Location Tokenization
von: Chen, Yile, et al.
Veröffentlicht: (2025)
von: Chen, Yile, et al.
Veröffentlicht: (2025)
Regional Tiny Stories: Using Small Models to Compare Language Learning and Tokenizer Performance
von: Patil, Nirvan, et al.
Veröffentlicht: (2025)
von: Patil, Nirvan, et al.
Veröffentlicht: (2025)
On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation
von: Hsu, Chan-Jan, et al.
Veröffentlicht: (2026)
von: Hsu, Chan-Jan, et al.
Veröffentlicht: (2026)
Token-Efficient Leverage Learning in Large Language Models
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages
von: Tamang, S., et al.
Veröffentlicht: (2024)
von: Tamang, S., et al.
Veröffentlicht: (2024)
Still Not Quite There! Evaluating Large Language Models for Comorbid Mental Health Diagnosis
von: Hengle, Amey, et al.
Veröffentlicht: (2024)
von: Hengle, Amey, et al.
Veröffentlicht: (2024)
Curved Inference: Concern-Sensitive Geometry in Large Language Model Residual Streams
von: Manson, Rob
Veröffentlicht: (2025)
von: Manson, Rob
Veröffentlicht: (2025)
Generation, Evaluation, and Explanation of Novelists' Styles with Single-Token Prompts
von: Rezaei, Mosab, et al.
Veröffentlicht: (2025)
von: Rezaei, Mosab, et al.
Veröffentlicht: (2025)
Token Alignment via Character Matching for Subword Completion
von: Athiwaratkun, Ben, et al.
Veröffentlicht: (2024)
von: Athiwaratkun, Ben, et al.
Veröffentlicht: (2024)
Emotion Classification in Low and Moderate Resource Languages
von: Tafreshi, Shabnam, et al.
Veröffentlicht: (2024)
von: Tafreshi, Shabnam, et al.
Veröffentlicht: (2024)
Question Difficulty Ranking for Multiple-Choice Reading Comprehension
von: Raina, Vatsal, et al.
Veröffentlicht: (2024)
von: Raina, Vatsal, et al.
Veröffentlicht: (2024)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution
von: Jin, Qiao, et al.
Veröffentlicht: (2026)
von: Jin, Qiao, et al.
Veröffentlicht: (2026)
Thinking Tokens for Language Modeling
von: Herel, David, et al.
Veröffentlicht: (2024)
von: Herel, David, et al.
Veröffentlicht: (2024)
Revisiting Graph-Tokenizing Large Language Models: A Systematic Evaluation of Graph Token Understanding
von: Zhang, Zhongjian, et al.
Veröffentlicht: (2026)
von: Zhang, Zhongjian, et al.
Veröffentlicht: (2026)
Evaluation of Large Language Models via Coupled Token Generation
von: Benz, Nina Corvelo, et al.
Veröffentlicht: (2025)
von: Benz, Nina Corvelo, et al.
Veröffentlicht: (2025)
On The Truthfulness of 'Surprisingly Likely' Responses of Large Language Models
von: Goel, Naman
Veröffentlicht: (2023)
von: Goel, Naman
Veröffentlicht: (2023)
TokenButler: Token Importance is Predictable
von: Akhauri, Yash, et al.
Veröffentlicht: (2025)
von: Akhauri, Yash, et al.
Veröffentlicht: (2025)
Robustness of Large Language Models to Perturbations in Text
von: Singh, Ayush, et al.
Veröffentlicht: (2024)
von: Singh, Ayush, et al.
Veröffentlicht: (2024)
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
von: Bi, Zhenyu, et al.
Veröffentlicht: (2025)
von: Bi, Zhenyu, et al.
Veröffentlicht: (2025)
Convergent Evolution: How Different Language Models Learn Similar Number Representations
von: Fu, Deqing, et al.
Veröffentlicht: (2026)
von: Fu, Deqing, et al.
Veröffentlicht: (2026)
Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate
von: Chern, Steffi, et al.
Veröffentlicht: (2024)
von: Chern, Steffi, et al.
Veröffentlicht: (2024)
ProtocolLLM: RTL Benchmark for SystemVerilog Generation of Communication Protocols
von: Sheth, Arnav, et al.
Veröffentlicht: (2025)
von: Sheth, Arnav, et al.
Veröffentlicht: (2025)
Tokenization Matters! Degrading Large Language Models through Challenging Their Tokenization
von: Wang, Dixuan, et al.
Veröffentlicht: (2024)
von: Wang, Dixuan, et al.
Veröffentlicht: (2024)
SmallToLarge (S2L): Scalable Data Selection for Fine-tuning Large Language Models by Summarizing Training Trajectories of Small Models
von: Yang, Yu, et al.
Veröffentlicht: (2024)
von: Yang, Yu, et al.
Veröffentlicht: (2024)
Accelerating Multilingual Language Model for Excessively Tokenized Languages
von: Hong, Jimin, et al.
Veröffentlicht: (2024)
von: Hong, Jimin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Luna: An Evaluation Foundation Model to Catch Language Model Hallucinations with High Accuracy and Low Cost
von: Belyi, Masha, et al.
Veröffentlicht: (2024) -
HIDE and Seek: Detecting Hallucinations in Language Models via Decoupled Representations
von: Chatterjee, Anwoy, et al.
Veröffentlicht: (2025) -
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
von: Chandak, Nikhil, et al.
Veröffentlicht: (2025) -
Evaluating Language Model Context Windows: A "Working Memory" Test and Inference-time Correction
von: Dsouza, Amanda, et al.
Veröffentlicht: (2024) -
A Survey of Prompt Engineering Methods in Large Language Models for Different NLP Tasks
von: Vatsal, Shubham, et al.
Veröffentlicht: (2024)