LOOM-Scope: a comprehensive and efficient LOng-cOntext Model evaluation framework
Fuente:
arXiv
Salvato in:
| Autori principali: | Tang, Zecheng, Wang, Haitian, Qiu, Quantong, Ji, Baibei, Sun, Ruoxi, Zhou, Keyan, Li, Juntao, Zhang, Min |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LOGO -- Long cOntext aliGnment via efficient preference Optimization
di: Tang, Zecheng, et al.
Pubblicazione: (2024)
di: Tang, Zecheng, et al.
Pubblicazione: (2024)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
L-CiteEval: Do Long-Context Models Truly Leverage Context for Responding?
di: Tang, Zecheng, et al.
Pubblicazione: (2024)
di: Tang, Zecheng, et al.
Pubblicazione: (2024)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
Revisiting Long-context Modeling from Context Denoising Perspective
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading
di: Ji, Baibei, et al.
Pubblicazione: (2026)
di: Ji, Baibei, et al.
Pubblicazione: (2026)
CMD: a framework for Context-aware Model self-Detoxification
di: Tang, Zecheng, et al.
Pubblicazione: (2023)
di: Tang, Zecheng, et al.
Pubblicazione: (2023)
Revealing and Mitigating Over-Attention in Knowledge Editing
di: Wang, Pinzheng, et al.
Pubblicazione: (2025)
di: Wang, Pinzheng, et al.
Pubblicazione: (2025)
Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
di: Qiu, Quantong, et al.
Pubblicazione: (2026)
di: Qiu, Quantong, et al.
Pubblicazione: (2026)
Elastic Attention: Test-time Adaptive Sparsity Ratios for Efficient Transformers
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
di: Zhou, Keyan, et al.
Pubblicazione: (2025)
di: Zhou, Keyan, et al.
Pubblicazione: (2025)
MemLong: Memory-Augmented Retrieval for Long Text Modeling
di: Liu, Weijie, et al.
Pubblicazione: (2024)
di: Liu, Weijie, et al.
Pubblicazione: (2024)
Accurate KV Cache Quantization with Outlier Tokens Tracing
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
CaliDrop: KV Cache Compression with Calibration
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
Revealing and Mitigating the Local Pattern Shortcuts of Mamba
di: You, Wangjie, et al.
Pubblicazione: (2024)
di: You, Wangjie, et al.
Pubblicazione: (2024)
Rethinking Negative Instances for Generative Named Entity Recognition
di: Ding, Yuyang, et al.
Pubblicazione: (2024)
di: Ding, Yuyang, et al.
Pubblicazione: (2024)
Text Style Transfer with Parameter-efficient LLM Finetuning and Round-trip Translation
di: Liu, Ruoxi, et al.
Pubblicazione: (2026)
di: Liu, Ruoxi, et al.
Pubblicazione: (2026)
Think Before You Prune: Selective Self-Generated Calibration for Pruning Large Reasoning Models
di: Xiang, Yang, et al.
Pubblicazione: (2025)
di: Xiang, Yang, et al.
Pubblicazione: (2025)
OpenBA: An Open-sourced 15B Bilingual Asymmetric seq2seq Model Pre-trained from Scratch
di: Li, Juntao, et al.
Pubblicazione: (2023)
di: Li, Juntao, et al.
Pubblicazione: (2023)
PsychBench: A comprehensive and professional benchmark for evaluating the performance of LLM-assisted psychiatric clinical practice
di: Liu, Shuyu, et al.
Pubblicazione: (2025)
di: Liu, Shuyu, et al.
Pubblicazione: (2025)
Navigation with VLM framework: Towards Going to Any Language
di: Yin, Zecheng, et al.
Pubblicazione: (2024)
di: Yin, Zecheng, et al.
Pubblicazione: (2024)
The Power of Personality: A Human Simulation Perspective to Investigate Large Language Model Agents
di: Duan, Yifan, et al.
Pubblicazione: (2025)
di: Duan, Yifan, et al.
Pubblicazione: (2025)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
di: Zhou, Jiayi, et al.
Pubblicazione: (2024)
Large Language Models Often Say One Thing and Do Another
di: Xu, Ruoxi, et al.
Pubblicazione: (2025)
di: Xu, Ruoxi, et al.
Pubblicazione: (2025)
Effective Large Language Model Adaptation for Improved Grounding and Citation Generation
di: Ye, Xi, et al.
Pubblicazione: (2023)
di: Ye, Xi, et al.
Pubblicazione: (2023)
Improving Rationality in the Reasoning Process of Language Models through Self-playing Game
di: Wang, Pinzheng, et al.
Pubblicazione: (2025)
di: Wang, Pinzheng, et al.
Pubblicazione: (2025)
LongFlow: Efficient KV Cache Compression for Reasoning Models
di: Su, Yi, et al.
Pubblicazione: (2026)
di: Su, Yi, et al.
Pubblicazione: (2026)
Demonstration Augmentation for Zero-shot In-context Learning
di: Su, Yi, et al.
Pubblicazione: (2024)
di: Su, Yi, et al.
Pubblicazione: (2024)
OpenBA-V2: Reaching 77.3% High Compression Ratio with Fast Multi-Stage Pruning
di: Qiao, Dan, et al.
Pubblicazione: (2024)
di: Qiao, Dan, et al.
Pubblicazione: (2024)
A unified foundational framework for knowledge injection and evaluation of Large Language Models in Combustion Science
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
Language Models Resist Alignment: Evidence From Data Compression
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
di: Tang, Wenjie, et al.
Pubblicazione: (2025)
di: Tang, Wenjie, et al.
Pubblicazione: (2025)
A comprehensive cross-language framework for harmful content detection with the aid of sentiment analysis
di: Dehghani, Mohammad
Pubblicazione: (2024)
di: Dehghani, Mohammad
Pubblicazione: (2024)
Hierarchical Contextual Manifold Alignment for Structuring Latent Representations in Large Language Models
di: Dong, Meiquan, et al.
Pubblicazione: (2025)
di: Dong, Meiquan, et al.
Pubblicazione: (2025)
Data-Centric Improvements for Enhancing Multi-Modal Understanding in Spoken Conversation Modeling
di: Chen, Maximillian, et al.
Pubblicazione: (2024)
di: Chen, Maximillian, et al.
Pubblicazione: (2024)
SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
di: Feng, Kehua, et al.
Pubblicazione: (2024)
di: Feng, Kehua, et al.
Pubblicazione: (2024)
Complex event recognition under time constraints: towards a formal framework for efficient query evaluation
di: García, Julián, et al.
Pubblicazione: (2025)
di: García, Julián, et al.
Pubblicazione: (2025)
A linguistically-motivated evaluation methodology for unraveling model's abilities in reading comprehension tasks
di: Antoine, Elie, et al.
Pubblicazione: (2025)
di: Antoine, Elie, et al.
Pubblicazione: (2025)
RadEval: A framework for radiology text evaluation
di: Xu, Justin, et al.
Pubblicazione: (2025)
di: Xu, Justin, et al.
Pubblicazione: (2025)
Where Matters More Than What: Decoding-aligned KV Cache Compression via Position-aware Pseudo Queries
di: Tian, Zhenxu, et al.
Pubblicazione: (2026)
di: Tian, Zhenxu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
LOGO -- Long cOntext aliGnment via efficient preference Optimization
di: Tang, Zecheng, et al.
Pubblicazione: (2024) -
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
di: Tang, Zecheng, et al.
Pubblicazione: (2025) -
L-CiteEval: Do Long-Context Models Truly Leverage Context for Responding?
di: Tang, Zecheng, et al.
Pubblicazione: (2024) -
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
di: Tang, Zecheng, et al.
Pubblicazione: (2026) -
Revisiting Long-context Modeling from Context Denoising Perspective
di: Tang, Zecheng, et al.
Pubblicazione: (2025)