SCALAR: Scientific Citation-based Live Assessment of Long-context Academic Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Renxi, Mu, Honglin, Ma, Liqun, Lin, Lizhi, Feng, Yunlong, Baldwin, Timothy, Han, Xudong, Li, Haonan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents
par: Wang, Renxi, et autres
Publié: (2024)
par: Wang, Renxi, et autres
Publié: (2024)
Against The Achilles' Heel: A Survey on Red Teaming for Generative Models
par: Lin, Lizhi, et autres
Publié: (2024)
par: Lin, Lizhi, et autres
Publié: (2024)
ToolGen: Unified Tool Retrieval and Calling via Generation
par: Wang, Renxi, et autres
Publié: (2024)
par: Wang, Renxi, et autres
Publié: (2024)
Demystifying Instruction Mixing for Fine-tuning Large Language Models
par: Wang, Renxi, et autres
Publié: (2023)
par: Wang, Renxi, et autres
Publié: (2023)
From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
par: Puerto, Haritz, et autres
Publié: (2026)
par: Puerto, Haritz, et autres
Publié: (2026)
Control Illusion: The Failure of Instruction Hierarchies in Large Language Models
par: Geng, Yilin, et autres
Publié: (2025)
par: Geng, Yilin, et autres
Publié: (2025)
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
par: Wang, Yuxia, et autres
Publié: (2024)
par: Wang, Yuxia, et autres
Publié: (2024)
Benchmarking Gender and Political Bias in Large Language Models
par: Yang, Jinrui, et autres
Publié: (2025)
par: Yang, Jinrui, et autres
Publié: (2025)
RuozhiBench: Evaluating LLMs with Logical Fallacies and Misleading Premises
par: Zhai, Zenan, et autres
Publié: (2025)
par: Zhai, Zenan, et autres
Publié: (2025)
Location Aware Modular Biencoder for Tourism Question Answering
par: Li, Haonan, et autres
Publié: (2024)
par: Li, Haonan, et autres
Publié: (2024)
LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-context QA
par: Zhang, Jiajie, et autres
Publié: (2024)
par: Zhang, Jiajie, et autres
Publié: (2024)
AcademicEval: Live Long-Context LLM Benchmark
par: Zhang, Haozhen, et autres
Publié: (2025)
par: Zhang, Haozhen, et autres
Publié: (2025)
Beyond Static Evaluation: A Dynamic Approach to Assessing AI Assistants' API Invocation Capabilities
par: Mu, Honglin, et autres
Publié: (2024)
par: Mu, Honglin, et autres
Publié: (2024)
SCALAR: A Part-of-speech Tagger for Identifiers
par: Newman, Christian D., et autres
Publié: (2025)
par: Newman, Christian D., et autres
Publié: (2025)
AI Security Beyond Core Domains: Resume Screening as a Case Study of Adversarial Vulnerabilities in Specialized LLM Applications
par: Mu, Honglin, et autres
Publié: (2025)
par: Mu, Honglin, et autres
Publié: (2025)
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
par: Mu, Honglin, et autres
Publié: (2024)
par: Mu, Honglin, et autres
Publié: (2024)
A Minimalist Proof Language for Neural Theorem Proving over Isabelle/HOL
par: Xu, Qiyuan, et autres
Publié: (2025)
par: Xu, Qiyuan, et autres
Publié: (2025)
Loki: An Open-Source Tool for Fact Verification
par: Li, Haonan, et autres
Publié: (2024)
par: Li, Haonan, et autres
Publié: (2024)
PsyGUARD: An Automated System for Suicide Detection and Risk Assessment in Psychological Counseling
par: Qiu, Huachuan, et autres
Publié: (2024)
par: Qiu, Huachuan, et autres
Publié: (2024)
Eliciting In-context Retrieval and Reasoning for Long-context Large Language Models
par: Qiu, Yifu, et autres
Publié: (2025)
par: Qiu, Yifu, et autres
Publié: (2025)
Self-Constructed Context Decompilation with Fined-grained Alignment Enhancement
par: Feng, Yunlong, et autres
Publié: (2024)
par: Feng, Yunlong, et autres
Publié: (2024)
IndoCulture: Exploring Geographically-Influenced Cultural Commonsense Reasoning Across Eleven Indonesian Provinces
par: Koto, Fajri, et autres
Publié: (2024)
par: Koto, Fajri, et autres
Publié: (2024)
Are Multilingual LLMs Culturally-Diverse Reasoners? An Investigation into Multicultural Proverbs and Sayings
par: Liu, Chen Cecilia, et autres
Publié: (2023)
par: Liu, Chen Cecilia, et autres
Publié: (2023)
A Little Leak Will Sink a Great Ship: Survey of Transparency for Large Language Models from Start to Finish
par: Kaneko, Masahiro, et autres
Publié: (2024)
par: Kaneko, Masahiro, et autres
Publié: (2024)
Does Vision Accelerate Hierarchical Generalization in Neural Language Learners?
par: Kuribayashi, Tatsuki, et autres
Publié: (2023)
par: Kuribayashi, Tatsuki, et autres
Publié: (2023)
Bi-Mamba: Towards Accurate 1-Bit State Space Models
par: Tang, Shengkun, et autres
Publié: (2024)
par: Tang, Shengkun, et autres
Publié: (2024)
DRT: Deep Reasoning Translation via Long Chain-of-Thought
par: Wang, Jiaan, et autres
Publié: (2024)
par: Wang, Jiaan, et autres
Publié: (2024)
ScholarCopilot: Training Large Language Models for Academic Writing with Accurate Citations
par: Wang, Yubo, et autres
Publié: (2025)
par: Wang, Yubo, et autres
Publié: (2025)
Evaluating Evidence Attribution in Generated Fact Checking Explanations
par: Xing, Rui, et autres
Publié: (2024)
par: Xing, Rui, et autres
Publié: (2024)
A Cognitive Writing Perspective for Constrained Long-Form Text Generation
par: Wan, Kaiyang, et autres
Publié: (2025)
par: Wan, Kaiyang, et autres
Publié: (2025)
Citation-Enhanced Generation for LLM-based Chatbots
par: Li, Weitao, et autres
Publié: (2024)
par: Li, Weitao, et autres
Publié: (2024)
A Decomposition Perspective to Long-context Reasoning for LLMs
par: Xiao, Yanling, et autres
Publié: (2026)
par: Xiao, Yanling, et autres
Publié: (2026)
Scientific Reasoning: Assessment of Multimodal Generative LLMs
par: Dreyer, Florian, et autres
Publié: (2025)
par: Dreyer, Florian, et autres
Publié: (2025)
CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and Reasoning
par: Cui, Hao, et autres
Publié: (2025)
par: Cui, Hao, et autres
Publié: (2025)
EchoReview: Learning Peer Review from the Echoes of Scientific Citations
par: Zhang, Yinuo, et autres
Publié: (2026)
par: Zhang, Yinuo, et autres
Publié: (2026)
Ref-Long: Benchmarking the Long-context Referencing Capability of Long-context Language Models
par: Wu, Junjie, et autres
Publié: (2025)
par: Wu, Junjie, et autres
Publié: (2025)
ALR$^2$: A Retrieve-then-Reason Framework for Long-context Question Answering
par: Li, Huayang, et autres
Publié: (2024)
par: Li, Huayang, et autres
Publié: (2024)
On the Interplay between Human Label Variation and Model Fairness
par: Kurniawan, Kemal, et autres
Publié: (2025)
par: Kurniawan, Kemal, et autres
Publié: (2025)
To Aggregate or Not to Aggregate. That is the Question: A Case Study on Annotation Subjectivity in Span Prediction
par: Kurniawan, Kemal, et autres
Publié: (2024)
par: Kurniawan, Kemal, et autres
Publié: (2024)
Long-context LLMs Struggle with Long In-context Learning
par: Li, Tianle, et autres
Publié: (2024)
par: Li, Tianle, et autres
Publié: (2024)
Documents similaires
-
Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents
par: Wang, Renxi, et autres
Publié: (2024) -
Against The Achilles' Heel: A Survey on Red Teaming for Generative Models
par: Lin, Lizhi, et autres
Publié: (2024) -
ToolGen: Unified Tool Retrieval and Calling via Generation
par: Wang, Renxi, et autres
Publié: (2024) -
Demystifying Instruction Mixing for Fine-tuning Large Language Models
par: Wang, Renxi, et autres
Publié: (2023) -
From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
par: Puerto, Haritz, et autres
Publié: (2026)