ELITR-Bench: A Meeting Assistant Benchmark for Long-Context Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Thonet, Thibaut, Rozen, Jos, Besacier, Laurent |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
MileBench: Benchmarking MLLMs in Long Context
por: Song, Dingjie, et al.
Publicado: (2024)
por: Song, Dingjie, et al.
Publicado: (2024)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
por: Long, Xiang, et al.
Publicado: (2026)
por: Long, Xiang, et al.
Publicado: (2026)
Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context
por: Alizadeh, Keivan, et al.
Publicado: (2026)
por: Alizadeh, Keivan, et al.
Publicado: (2026)
Revisiting In-Context Learning with Long Context Language Models
por: Baek, Jinheon, et al.
Publicado: (2024)
por: Baek, Jinheon, et al.
Publicado: (2024)
VL-RouterBench: A Benchmark for Vision-Language Model Routing
por: Huang, Zhehao, et al.
Publicado: (2025)
por: Huang, Zhehao, et al.
Publicado: (2025)
Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAG
por: Jin, Bowen, et al.
Publicado: (2024)
por: Jin, Bowen, et al.
Publicado: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
por: Liu, Xiao, et al.
Publicado: (2023)
por: Liu, Xiao, et al.
Publicado: (2023)
Guaranteed Generation from Large Language Models
por: Kim, Minbeom, et al.
Publicado: (2024)
por: Kim, Minbeom, et al.
Publicado: (2024)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
por: Lee, Jaeho, et al.
Publicado: (2025)
por: Lee, Jaeho, et al.
Publicado: (2025)
When Thoughts Meet Facts: Reusable Reasoning for Long-Context LMs
por: Jeong, Soyeong, et al.
Publicado: (2025)
por: Jeong, Soyeong, et al.
Publicado: (2025)
VoiceAgentBench: Are Voice Assistants ready for agentic tasks?
por: Jain, Dhruv, et al.
Publicado: (2025)
por: Jain, Dhruv, et al.
Publicado: (2025)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
por: Song, Xiaoshuai, et al.
Publicado: (2024)
por: Song, Xiaoshuai, et al.
Publicado: (2024)
FaST: Feature-aware Sampling and Tuning for Personalized Preference Alignment with Limited Data
por: Thonet, Thibaut, et al.
Publicado: (2025)
por: Thonet, Thibaut, et al.
Publicado: (2025)
AcademicEval: Live Long-Context LLM Benchmark
por: Zhang, Haozhen, et al.
Publicado: (2025)
por: Zhang, Haozhen, et al.
Publicado: (2025)
LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models
por: Chen, Yukang, et al.
Publicado: (2023)
por: Chen, Yukang, et al.
Publicado: (2023)
AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models
por: Zbeeb, Mohammad, et al.
Publicado: (2025)
por: Zbeeb, Mohammad, et al.
Publicado: (2025)
Findings of the Third Automatic Minuting (AutoMin) Challenge
por: Shinde, Kartik, et al.
Publicado: (2025)
por: Shinde, Kartik, et al.
Publicado: (2025)
SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
por: Hu, Tiancheng, et al.
Publicado: (2025)
por: Hu, Tiancheng, et al.
Publicado: (2025)
PersonaLens: A Benchmark for Personalization Evaluation in Conversational AI Assistants
por: Zhao, Zheng, et al.
Publicado: (2025)
por: Zhao, Zheng, et al.
Publicado: (2025)
Stress-Testing Long-Context Language Models with Lifelong ICL and Task Haystack
por: Xu, Xiaoyue, et al.
Publicado: (2024)
por: Xu, Xiaoyue, et al.
Publicado: (2024)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
por: Tang, Anke, et al.
Publicado: (2024)
por: Tang, Anke, et al.
Publicado: (2024)
Uncovering Deceptive Tendencies in Language Models: A Simulated Company AI Assistant
por: Järviniemi, Olli, et al.
Publicado: (2024)
por: Järviniemi, Olli, et al.
Publicado: (2024)
The Impossibility Triangle of Long-Context Modeling
por: Zhou, Yan
Publicado: (2026)
por: Zhou, Yan
Publicado: (2026)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
por: Li, Lijun, et al.
Publicado: (2024)
por: Li, Lijun, et al.
Publicado: (2024)
Bench to the Future: A Pastcasting Benchmark for Forecasting Agents
por: FutureSearch, et al.
Publicado: (2025)
por: FutureSearch, et al.
Publicado: (2025)
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models
por: Zhang, Junyang, et al.
Publicado: (2025)
por: Zhang, Junyang, et al.
Publicado: (2025)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
por: Shi, Dachuan, et al.
Publicado: (2025)
por: Shi, Dachuan, et al.
Publicado: (2025)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
por: Tan, Sijun, et al.
Publicado: (2024)
por: Tan, Sijun, et al.
Publicado: (2024)
ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities
por: Karger, Ezra, et al.
Publicado: (2024)
por: Karger, Ezra, et al.
Publicado: (2024)
LiveBench: A Challenging, Contamination-Limited LLM Benchmark
por: White, Colin, et al.
Publicado: (2024)
por: White, Colin, et al.
Publicado: (2024)
AfroBench: How Good are Large Language Models on African Languages?
por: Ojo, Jessica, et al.
Publicado: (2023)
por: Ojo, Jessica, et al.
Publicado: (2023)
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
por: Wang, Hengyi, et al.
Publicado: (2024)
por: Wang, Hengyi, et al.
Publicado: (2024)
PromptBench: A Unified Library for Evaluation of Large Language Models
por: Zhu, Kaijie, et al.
Publicado: (2023)
por: Zhu, Kaijie, et al.
Publicado: (2023)
Too Long, Didn't Model: Decomposing LLM Long-Context Understanding With Novels
por: Hamilton, Sil, et al.
Publicado: (2025)
por: Hamilton, Sil, et al.
Publicado: (2025)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
por: Lin, Zicheng, et al.
Publicado: (2024)
por: Lin, Zicheng, et al.
Publicado: (2024)
SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization
por: Yuan, Jiarui, et al.
Publicado: (2026)
por: Yuan, Jiarui, et al.
Publicado: (2026)
Retrieval meets Long Context Large Language Models
por: Xu, Peng, et al.
Publicado: (2023)
por: Xu, Peng, et al.
Publicado: (2023)
LLaSA: Large Language and Structured Data Assistant
por: Xu, Yao, et al.
Publicado: (2024)
por: Xu, Yao, et al.
Publicado: (2024)
Ejemplares similares
-
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
por: Yang, Wang, et al.
Publicado: (2025) -
MileBench: Benchmarking MLLMs in Long Context
por: Song, Dingjie, et al.
Publicado: (2024) -
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
por: Long, Xiang, et al.
Publicado: (2026) -
Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context
por: Alizadeh, Keivan, et al.
Publicado: (2026) -
Revisiting In-Context Learning with Long Context Language Models
por: Baek, Jinheon, et al.
Publicado: (2024)