Salvato in:
| Autori principali: | Kohli, Harsh, Kumar, Sachin, Sun, Huan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2404.04237 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers
di: Kohli, Harsh, et al.
Pubblicazione: (2026)
di: Kohli, Harsh, et al.
Pubblicazione: (2026)
CE-Bench: Towards a Reliable Contrastive Evaluation Benchmark of Interpretability of Sparse Autoencoders
di: Gulko, Alex, et al.
Pubblicazione: (2025)
di: Gulko, Alex, et al.
Pubblicazione: (2025)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
di: Chen, Jiangxi, et al.
Pubblicazione: (2026)
di: Chen, Jiangxi, et al.
Pubblicazione: (2026)
Continually Adding New Languages to Multilingual Language Models
di: Owodunni, Abraham Toluwase, et al.
Pubblicazione: (2025)
di: Owodunni, Abraham Toluwase, et al.
Pubblicazione: (2025)
Meta-Tool: Efficient Few-Shot Tool Adaptation for Small Language Models
di: Kumar, Sachin
Pubblicazione: (2026)
di: Kumar, Sachin
Pubblicazione: (2026)
CocoaBench: Evaluating Unified Digital Agents in the Wild
di: CocoaBench Team, et al.
Pubblicazione: (2026)
di: CocoaBench Team, et al.
Pubblicazione: (2026)
Reasoning Up the Instruction Ladder for Controllable Language Models
di: Zheng, Zishuo, et al.
Pubblicazione: (2025)
di: Zheng, Zishuo, et al.
Pubblicazione: (2025)
ScholarEval: Research Idea Evaluation Grounded in Literature
di: Moussa, Hanane Nour, et al.
Pubblicazione: (2025)
di: Moussa, Hanane Nour, et al.
Pubblicazione: (2025)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
di: Zou, Chengke, et al.
Pubblicazione: (2024)
di: Zou, Chengke, et al.
Pubblicazione: (2024)
BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning
di: Jang, Min, et al.
Pubblicazione: (2026)
di: Jang, Min, et al.
Pubblicazione: (2026)
Compositional Generalization with Grounded Language Models
di: Wold, Sondre, et al.
Pubblicazione: (2024)
di: Wold, Sondre, et al.
Pubblicazione: (2024)
Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
di: Harsh, Reetu Raj, et al.
Pubblicazione: (2026)
di: Harsh, Reetu Raj, et al.
Pubblicazione: (2026)
CEI: A Benchmark for Evaluating Pragmatic Reasoning in Language Models
di: Chun, Jon, et al.
Pubblicazione: (2026)
di: Chun, Jon, et al.
Pubblicazione: (2026)
FLEXITOKENS: Flexible Tokenization for Evolving Language Models
di: Owodunni, Abraham Toluwase, et al.
Pubblicazione: (2025)
di: Owodunni, Abraham Toluwase, et al.
Pubblicazione: (2025)
Mathfish: Evaluating Language Model Math Reasoning via Grounding in Educational Curricula
di: Lucy, Li, et al.
Pubblicazione: (2024)
di: Lucy, Li, et al.
Pubblicazione: (2024)
Overriding Safety protections of Open-source Models
di: Kumar, Sachin
Pubblicazione: (2024)
di: Kumar, Sachin
Pubblicazione: (2024)
A Comparative Empirical Study of Catastrophic Forgetting Mitigation in Sequential Task Adaptation for Continual Natural Language Processing Systems
di: Abrahamyan, Aram, et al.
Pubblicazione: (2026)
di: Abrahamyan, Aram, et al.
Pubblicazione: (2026)
Compositional Causal Reasoning Evaluation in Language Models
di: Maasch, Jacqueline R. M. A., et al.
Pubblicazione: (2025)
di: Maasch, Jacqueline R. M. A., et al.
Pubblicazione: (2025)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
Steering Large Language Models between Code Execution and Textual Reasoning
di: Chen, Yongchao, et al.
Pubblicazione: (2024)
di: Chen, Yongchao, et al.
Pubblicazione: (2024)
TESS 2: A Large-Scale Generalist Diffusion Language Model
di: Tae, Jaesung, et al.
Pubblicazione: (2025)
di: Tae, Jaesung, et al.
Pubblicazione: (2025)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
di: Huang, Junquan, et al.
Pubblicazione: (2025)
di: Huang, Junquan, et al.
Pubblicazione: (2025)
VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models
di: Dong, Nguyen Tien, et al.
Pubblicazione: (2025)
di: Dong, Nguyen Tien, et al.
Pubblicazione: (2025)
CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models
di: Wang, Song, et al.
Pubblicazione: (2024)
di: Wang, Song, et al.
Pubblicazione: (2024)
Metric-Dependent Annotation Saturation for Learning from Label Distributions
di: Kohli, Guneet
Pubblicazione: (2026)
di: Kohli, Guneet
Pubblicazione: (2026)
Role-Conditioned Refusals: Evaluating Access Control Reasoning in Large Language Models
di: Klisura, Đorđe, et al.
Pubblicazione: (2025)
di: Klisura, Đorđe, et al.
Pubblicazione: (2025)
How Lexical is Bilingual Lexicon Induction?
di: Kohli, Harsh, et al.
Pubblicazione: (2024)
di: Kohli, Harsh, et al.
Pubblicazione: (2024)
MentalBench: A DSM-Grounded Benchmark for Evaluating Psychiatric Diagnostic Capability of Large Language Models
di: Song, Hoyun, et al.
Pubblicazione: (2026)
di: Song, Hoyun, et al.
Pubblicazione: (2026)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
Paloma: A Benchmark for Evaluating Language Model Fit
di: Magnusson, Ian, et al.
Pubblicazione: (2023)
di: Magnusson, Ian, et al.
Pubblicazione: (2023)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
di: Liu, Daixian, et al.
Pubblicazione: (2026)
di: Liu, Daixian, et al.
Pubblicazione: (2026)
RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
di: Wang, Yuqing, et al.
Pubblicazione: (2024)
DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams
di: Iyengar, Anirudh Iyengar Kaniyar Narayana, et al.
Pubblicazione: (2026)
di: Iyengar, Anirudh Iyengar Kaniyar Narayana, et al.
Pubblicazione: (2026)
Pause or Fabricate? Training Language Models for Grounded Reasoning
di: Qiu, Yiwen, et al.
Pubblicazione: (2026)
di: Qiu, Yiwen, et al.
Pubblicazione: (2026)
Benchmarking Distilled Language Models: Performance and Efficiency in Resource-Constrained Settings
di: Wani, Sachin Gopal, et al.
Pubblicazione: (2026)
di: Wani, Sachin Gopal, et al.
Pubblicazione: (2026)
Evaluating Large Language Models on the Frame and Symbol Grounding Problems: A Zero-shot Benchmark
di: Oka, Shoko
Pubblicazione: (2025)
di: Oka, Shoko
Pubblicazione: (2025)
SANSKRITI: A Comprehensive Benchmark for Evaluating Language Models' Knowledge of Indian Culture
di: Maji, Arijit, et al.
Pubblicazione: (2025)
di: Maji, Arijit, et al.
Pubblicazione: (2025)
Evaluation of Deontic Conditional Reasoning in Large Language Models: The Case of Wason's Selection Task
di: Abe, Hirohiko, et al.
Pubblicazione: (2026)
di: Abe, Hirohiko, et al.
Pubblicazione: (2026)
Reasoning-Grounded Natural Language Explanations for Language Models
di: Cahlik, Vojtech, et al.
Pubblicazione: (2025)
di: Cahlik, Vojtech, et al.
Pubblicazione: (2025)
ValueGround: Evaluating Culture-Conditioned Visual Value Grounding in MLLMs
di: Wang, Zhipin, et al.
Pubblicazione: (2026)
di: Wang, Zhipin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers
di: Kohli, Harsh, et al.
Pubblicazione: (2026) -
CE-Bench: Towards a Reliable Contrastive Evaluation Benchmark of Interpretability of Sparse Autoencoders
di: Gulko, Alex, et al.
Pubblicazione: (2025) -
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
di: Chen, Jiangxi, et al.
Pubblicazione: (2026) -
Continually Adding New Languages to Multilingual Language Models
di: Owodunni, Abraham Toluwase, et al.
Pubblicazione: (2025) -
Meta-Tool: Efficient Few-Shot Tool Adaptation for Small Language Models
di: Kumar, Sachin
Pubblicazione: (2026)