Evaluation of Large Language Models via Coupled Token Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Benz, Nina Corvelo, Tsirtsis, Stratis, Straitouri, Eleni, Chatzi, Ivi, Velasco, Ander Artola, Thejaswi, Suhas, Gomez-Rodriguez, Manuel |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Counterfactual Token Generation in Large Language Models
by: Chatzi, Ivi, et al.
Published: (2024)
by: Chatzi, Ivi, et al.
Published: (2024)
Tokenization Multiplicity Leads to Arbitrary Price Variation in LLM-as-a-service
by: Chatzi, Ivi, et al.
Published: (2025)
by: Chatzi, Ivi, et al.
Published: (2025)
Prediction-Powered Ranking of Large Language Models
by: Chatzi, Ivi, et al.
Published: (2024)
by: Chatzi, Ivi, et al.
Published: (2024)
Narrowing Action Choices with AI Improves Human Sequential Decisions
by: Straitouri, Eleni, et al.
Published: (2025)
by: Straitouri, Eleni, et al.
Published: (2025)
Auditing Pay-Per-Token in Large Language Models
by: Velasco, Ander Artola, et al.
Published: (2025)
by: Velasco, Ander Artola, et al.
Published: (2025)
Learning to Decide with AI Assistance under Human-Alignment
by: Benz, Nina Corvelo, et al.
Published: (2026)
by: Benz, Nina Corvelo, et al.
Published: (2026)
Is Your LLM Overcharging You? Tokenization, Transparency, and Incentives
by: Velasco, Ander Artola, et al.
Published: (2025)
by: Velasco, Ander Artola, et al.
Published: (2025)
Optimizing Social Utility in Sequential Experiments
by: Velasco, Ander Artola, et al.
Published: (2026)
by: Velasco, Ander Artola, et al.
Published: (2026)
Controlling Counterfactual Harm in Decision Support Systems Based on Prediction Sets
by: Straitouri, Eleni, et al.
Published: (2024)
by: Straitouri, Eleni, et al.
Published: (2024)
Matchings, Predictions and Counterfactual Harm in Refugee Resettlement Processes
by: Lee, Seungeon, et al.
Published: (2024)
by: Lee, Seungeon, et al.
Published: (2024)
Test-Time Compute Games
by: Velasco, Ander Artola, et al.
Published: (2026)
by: Velasco, Ander Artola, et al.
Published: (2026)
Towards Human-AI Complementarity in Matching Tasks
by: Arnaiz-Rodriguez, Adrian, et al.
Published: (2025)
by: Arnaiz-Rodriguez, Adrian, et al.
Published: (2025)
Towards Human-AI Complementarity with Prediction Sets
by: De Toni, Giovanni, et al.
Published: (2024)
by: De Toni, Giovanni, et al.
Published: (2024)
Human-Alignment Influences the Utility of AI-assisted Decision Making
by: Benz, Nina L. Corvelo, et al.
Published: (2025)
by: Benz, Nina L. Corvelo, et al.
Published: (2025)
Human-Aligned Calibration for AI-Assisted Decision Making
by: Benz, Nina L. Corvelo, et al.
Published: (2023)
by: Benz, Nina L. Corvelo, et al.
Published: (2023)
Designing Decision Support Systems Using Counterfactual Prediction Sets
by: Straitouri, Eleni, et al.
Published: (2023)
by: Straitouri, Eleni, et al.
Published: (2023)
MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents
by: Anand, Ashwani, et al.
Published: (2026)
by: Anand, Ashwani, et al.
Published: (2026)
On the Hardness of Approximation of the Fair k-Center Problem
by: Thejaswi, Suhas
Published: (2026)
by: Thejaswi, Suhas
Published: (2026)
AI-Mediated Communication Can Steer Collective Opinion
by: Tsirtsis, Stratis, et al.
Published: (2026)
by: Tsirtsis, Stratis, et al.
Published: (2026)
Capacitated Fair-Range Clustering: Hardness and Approximation Algorithms
by: Gadekar, Ameet, et al.
Published: (2025)
by: Gadekar, Ameet, et al.
Published: (2025)
Optimal Decision Making Under Strategic Behavior
by: Tsirtsis, Stratis, et al.
Published: (2019)
by: Tsirtsis, Stratis, et al.
Published: (2019)
Leveraging the Power of Large Language Models in Entity Linking via Adaptive Routing and Targeted Reasoning
by: Li, Yajie, et al.
Published: (2025)
by: Li, Yajie, et al.
Published: (2025)
Performance Evaluation of Tokenizers in Large Language Models for the Assamese Language
by: Tamang, Sagar, et al.
Published: (2024)
by: Tamang, Sagar, et al.
Published: (2024)
Evaluating Large Language Models with Tests of Spanish as a Foreign Language: Pass or Fail?
by: Mayor-Rocher, Marina, et al.
Published: (2024)
by: Mayor-Rocher, Marina, et al.
Published: (2024)
Multimodal Large Language Models for Low-Resource Languages: A Case Study for Basque
by: Arana, Lukas, et al.
Published: (2025)
by: Arana, Lukas, et al.
Published: (2025)
Fair Column Subset Selection
by: Matakos, Antonis, et al.
Published: (2023)
by: Matakos, Antonis, et al.
Published: (2023)
Fair Clustering for Data Summarization: Improved Approximation Algorithms and Complexity Insights
by: Gadekar, Ameet, et al.
Published: (2024)
by: Gadekar, Ameet, et al.
Published: (2024)
Restless reachability problems in temporal graphs
by: Thejaswi, Suhas, et al.
Published: (2020)
by: Thejaswi, Suhas, et al.
Published: (2020)
Problematic Tokens: Tokenizer Bias in Large Language Models
by: Yang, Jin, et al.
Published: (2024)
by: Yang, Jin, et al.
Published: (2024)
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
by: Mao, Yu, et al.
Published: (2025)
by: Mao, Yu, et al.
Published: (2025)
Step-by-Step Unmasking for Parameter-Efficient Fine-tuning of Large Language Models
by: Agarwal, Aradhye, et al.
Published: (2024)
by: Agarwal, Aradhye, et al.
Published: (2024)
Evaluating Tokenizer Performance of Large Language Models Across Official Indian Languages
by: Tamang, S., et al.
Published: (2024)
by: Tamang, S., et al.
Published: (2024)
Understanding Catastrophic Forgetting in Language Models via Implicit Inference
by: Kotha, Suhas, et al.
Published: (2023)
by: Kotha, Suhas, et al.
Published: (2023)
FTP: A Fine-grained Token-wise Pruner for Large Language Models via Token Routing
by: Li, Zekai, et al.
Published: (2024)
by: Li, Zekai, et al.
Published: (2024)
Rethinking Tokenization: Crafting Better Tokenizers for Large Language Models
by: Yang, Jinbiao
Published: (2024)
by: Yang, Jinbiao
Published: (2024)
Reframing Data Value for Large Language Models Through the Lens of Plausibility
by: Rammal, Mohamad Rida, et al.
Published: (2024)
by: Rammal, Mohamad Rida, et al.
Published: (2024)
Revisiting Graph-Tokenizing Large Language Models: A Systematic Evaluation of Graph Token Understanding
by: Zhang, Zhongjian, et al.
Published: (2026)
by: Zhang, Zhongjian, et al.
Published: (2026)
Estimating Knowledge in Large Language Models Without Generating a Single Token
by: Gottesman, Daniela, et al.
Published: (2024)
by: Gottesman, Daniela, et al.
Published: (2024)
Grounding Spatial Relations in Text-Only Language Models
by: Azkune, Gorka, et al.
Published: (2024)
by: Azkune, Gorka, et al.
Published: (2024)
Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads
by: Cherian, Anoop, et al.
Published: (2024)
by: Cherian, Anoop, et al.
Published: (2024)
Similar Items
-
Counterfactual Token Generation in Large Language Models
by: Chatzi, Ivi, et al.
Published: (2024) -
Tokenization Multiplicity Leads to Arbitrary Price Variation in LLM-as-a-service
by: Chatzi, Ivi, et al.
Published: (2025) -
Prediction-Powered Ranking of Large Language Models
by: Chatzi, Ivi, et al.
Published: (2024) -
Narrowing Action Choices with AI Improves Human Sequential Decisions
by: Straitouri, Eleni, et al.
Published: (2025) -
Auditing Pay-Per-Token in Large Language Models
by: Velasco, Ander Artola, et al.
Published: (2025)