Minerva: A Programmable Memory Test Benchmark for Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xia, Menglin, Ruehle, Victor, Rajmohan, Saravan, Shokri, Reza |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Towards Active Synthetic Data Generation for Finetuning Language Models
von: Kessler, Samuel, et al.
Veröffentlicht: (2025)
von: Kessler, Samuel, et al.
Veröffentlicht: (2025)
Budget-Aware Agentic Routing via Boundary-Guided Training
von: Zhang, Caiqi, et al.
Veröffentlicht: (2026)
von: Zhang, Caiqi, et al.
Veröffentlicht: (2026)
Hybrid-RACA: Hybrid Retrieval-Augmented Composition Assistance for Real-time Text Prediction
von: Xia, Menglin, et al.
Veröffentlicht: (2023)
von: Xia, Menglin, et al.
Veröffentlicht: (2023)
Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval Depth
von: Hashemi, Helia, et al.
Veröffentlicht: (2025)
von: Hashemi, Helia, et al.
Veröffentlicht: (2025)
Semantic Caching of Contextual Summaries for Efficient Question-Answering with Language Models
von: Couturier, Camille, et al.
Veröffentlicht: (2025)
von: Couturier, Camille, et al.
Veröffentlicht: (2025)
From Reasoning to Answer: Empirical, Attention-Based and Mechanistic Insights into Distilled DeepSeek R1 Models
von: Zhang, Jue, et al.
Veröffentlicht: (2025)
von: Zhang, Jue, et al.
Veröffentlicht: (2025)
Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks
von: Tan, Rongyuan, et al.
Veröffentlicht: (2026)
von: Tan, Rongyuan, et al.
Veröffentlicht: (2026)
OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
von: Wang, Weixuan, et al.
Veröffentlicht: (2025)
MEETING DELEGATE: Benchmarking LLMs on Attending Meetings on Our Behalf
von: Hu, Lingxiang, et al.
Veröffentlicht: (2025)
von: Hu, Lingxiang, et al.
Veröffentlicht: (2025)
CI-Work: Benchmarking Contextual Integrity in Enterprise LLM Agents
von: Fu, Wenjie, et al.
Veröffentlicht: (2026)
von: Fu, Wenjie, et al.
Veröffentlicht: (2026)
Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection
von: Liu, Jun, et al.
Veröffentlicht: (2024)
von: Liu, Jun, et al.
Veröffentlicht: (2024)
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
von: Gupta, Taneesh, et al.
Veröffentlicht: (2025)
von: Gupta, Taneesh, et al.
Veröffentlicht: (2025)
REFA: Reference Free Alignment for multi-preference optimization
von: Gupta, Taneesh, et al.
Veröffentlicht: (2024)
von: Gupta, Taneesh, et al.
Veröffentlicht: (2024)
CARMO: Dynamic Criteria Generation for Context-Aware Reward Modelling
von: Gupta, Taneesh, et al.
Veröffentlicht: (2024)
von: Gupta, Taneesh, et al.
Veröffentlicht: (2024)
Can LLMs Keep a Secret? Testing Privacy Implications of Language Models via Contextual Integrity Theory
von: Mireshghallah, Niloofar, et al.
Veröffentlicht: (2023)
von: Mireshghallah, Niloofar, et al.
Veröffentlicht: (2023)
Smaller Language Models are Better Black-box Machine-Generated Text Detectors
von: Mireshghallah, Niloofar, et al.
Veröffentlicht: (2023)
von: Mireshghallah, Niloofar, et al.
Veröffentlicht: (2023)
Text2Grad: Reinforcement Learning from Natural Language Feedback
von: Wang, Hanyang, et al.
Veröffentlicht: (2025)
von: Wang, Hanyang, et al.
Veröffentlicht: (2025)
WarriorCoder: Learning from Expert Battles to Augment Code Large Language Models
von: Feng, Huawen, et al.
Veröffentlicht: (2024)
von: Feng, Huawen, et al.
Veröffentlicht: (2024)
AgentGen: Enhancing Planning Abilities for Large Language Model based Agent via Environment and Task Generation
von: Hu, Mengkang, et al.
Veröffentlicht: (2024)
von: Hu, Mengkang, et al.
Veröffentlicht: (2024)
DI-BENCH: Benchmarking Large Language Models on Dependency Inference with Testable Repositories at Scale
von: Zhang, Linghao, et al.
Veröffentlicht: (2025)
von: Zhang, Linghao, et al.
Veröffentlicht: (2025)
WarriorMath: Enhancing the Mathematical Ability of Large Language Models with a Defect-aware Framework
von: Chen, Yue, et al.
Veröffentlicht: (2025)
von: Chen, Yue, et al.
Veröffentlicht: (2025)
LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
von: Sun, Lihao, et al.
Veröffentlicht: (2026)
von: Sun, Lihao, et al.
Veröffentlicht: (2026)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
von: Gupta, Taneesh, et al.
Veröffentlicht: (2024)
von: Gupta, Taneesh, et al.
Veröffentlicht: (2024)
Personalized Author Obfuscation with Large Language Models
von: Shokri, Mohammad, et al.
Veröffentlicht: (2025)
von: Shokri, Mohammad, et al.
Veröffentlicht: (2025)
Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?
von: Zhang, Yudi, et al.
Veröffentlicht: (2025)
von: Zhang, Yudi, et al.
Veröffentlicht: (2025)
Automated Root Causing of Cloud Incidents using In-Context Learning with GPT-4
von: Zhang, Xuchao, et al.
Veröffentlicht: (2024)
von: Zhang, Xuchao, et al.
Veröffentlicht: (2024)
Large Language Model-Brained GUI Agents: A Survey
von: Zhang, Chaoyun, et al.
Veröffentlicht: (2024)
von: Zhang, Chaoyun, et al.
Veröffentlicht: (2024)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
von: Chang, Hongyan, et al.
Veröffentlicht: (2024)
von: Chang, Hongyan, et al.
Veröffentlicht: (2024)
HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents
von: Zhu, Jinchang, et al.
Veröffentlicht: (2026)
von: Zhu, Jinchang, et al.
Veröffentlicht: (2026)
Exploring LLM-based Agents for Root Cause Analysis
von: Roy, Devjeet, et al.
Veröffentlicht: (2024)
von: Roy, Devjeet, et al.
Veröffentlicht: (2024)
Navigating the Unknown: A Chat-Based Collaborative Interface for Personalized Exploratory Tasks
von: Peng, Yingzhe, et al.
Veröffentlicht: (2024)
von: Peng, Yingzhe, et al.
Veröffentlicht: (2024)
Thinking with Nothinking Calibration: A New In-Context Learning Paradigm in Reasoning Large Language Models
von: Wu, Haotian, et al.
Veröffentlicht: (2025)
von: Wu, Haotian, et al.
Veröffentlicht: (2025)
Enhancing Language Models for Financial Relation Extraction with Named Entities and Part-of-Speech
von: Li, Menglin, et al.
Veröffentlicht: (2024)
von: Li, Menglin, et al.
Veröffentlicht: (2024)
Establishing Vocabulary Tests as a Benchmark for Evaluating Large Language Models
von: Martínez, Gonzalo, et al.
Veröffentlicht: (2023)
von: Martínez, Gonzalo, et al.
Veröffentlicht: (2023)
Do Large Language Model Benchmarks Test Reliability?
von: Vendrow, Joshua, et al.
Veröffentlicht: (2025)
von: Vendrow, Joshua, et al.
Veröffentlicht: (2025)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
von: Tang, Zecheng, et al.
Veröffentlicht: (2026)
von: Tang, Zecheng, et al.
Veröffentlicht: (2026)
Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory
von: Wei, Tianxin, et al.
Veröffentlicht: (2025)
von: Wei, Tianxin, et al.
Veröffentlicht: (2025)
Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity
von: Xia, Menglin, et al.
Veröffentlicht: (2026)
von: Xia, Menglin, et al.
Veröffentlicht: (2026)
ACON: Optimizing Context Compression for Long-horizon LLM Agents
von: Kang, Minki, et al.
Veröffentlicht: (2025)
von: Kang, Minki, et al.
Veröffentlicht: (2025)
RuAG: Learned-rule-augmented Generation for Large Language Models
von: Zhang, Yudi, et al.
Veröffentlicht: (2024)
von: Zhang, Yudi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Towards Active Synthetic Data Generation for Finetuning Language Models
von: Kessler, Samuel, et al.
Veröffentlicht: (2025) -
Budget-Aware Agentic Routing via Boundary-Guided Training
von: Zhang, Caiqi, et al.
Veröffentlicht: (2026) -
Hybrid-RACA: Hybrid Retrieval-Augmented Composition Assistance for Real-time Text Prediction
von: Xia, Menglin, et al.
Veröffentlicht: (2023) -
Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval Depth
von: Hashemi, Helia, et al.
Veröffentlicht: (2025) -
Semantic Caching of Contextual Summaries for Efficient Question-Answering with Language Models
von: Couturier, Camille, et al.
Veröffentlicht: (2025)