BenTo: Benchmark Task Reduction with In-Context Transferability
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Hongyu, Li, Ming, Sun, Lichao, Zhou, Tianyi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
par: Fan, Chenrui, et autres
Publié: (2025)
par: Fan, Chenrui, et autres
Publié: (2025)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
par: Sun, Ryan, et autres
Publié: (2024)
par: Sun, Ryan, et autres
Publié: (2024)
TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning
par: Yu, Fangxu, et autres
Publié: (2025)
par: Yu, Fangxu, et autres
Publié: (2025)
GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
par: Sun, Zhouhao, et autres
Publié: (2026)
par: Sun, Zhouhao, et autres
Publié: (2026)
In-Context Transfer Learning: Demonstration Synthesis by Transferring Similar Tasks
par: Wang, Dingzirui, et autres
Publié: (2024)
par: Wang, Dingzirui, et autres
Publié: (2024)
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
par: Huang, Yue, et autres
Publié: (2024)
par: Huang, Yue, et autres
Publié: (2024)
MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
par: Peng, Xueqing, et autres
Publié: (2025)
par: Peng, Xueqing, et autres
Publié: (2025)
Neuro-Symbolic Synergy for Interactive World Modeling
par: Zhao, Hongyu, et autres
Publié: (2026)
par: Zhao, Hongyu, et autres
Publié: (2026)
Superfiltering: Weak-to-Strong Data Filtering for Fast Instruction-Tuning
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
Submodular Context Partitioning and Compression for In-Context Learning
par: Zheng, Shaoyi, et autres
Publié: (2025)
par: Zheng, Shaoyi, et autres
Publié: (2025)
CodeIP: A Grammar-Guided Multi-Bit Watermark for Large Language Models of Code
par: Guan, Batu, et autres
Publié: (2024)
par: Guan, Batu, et autres
Publié: (2024)
Mosaic-IT: Cost-Free Compositional Data Synthesis for Instruction Tuning
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
FakeGPT: Fake News Generation, Explanation and Detection of Large Language Models
par: Huang, Yue, et autres
Publié: (2023)
par: Huang, Yue, et autres
Publié: (2023)
MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs
par: Zeng, Zhongshen, et autres
Publié: (2024)
par: Zeng, Zhongshen, et autres
Publié: (2024)
I Think, Therefore I am: Benchmarking Awareness of Large Language Models Using AwareBench
par: Li, Yuan, et autres
Publié: (2024)
par: Li, Yuan, et autres
Publié: (2024)
FinBen: A Holistic Financial Benchmark for Large Language Models
par: Xie, Qianqian, et autres
Publié: (2024)
par: Xie, Qianqian, et autres
Publié: (2024)
Does Socialization Emerge in AI Agent Society? A Case Study of Moltbook
par: Li, Ming, et autres
Publié: (2026)
par: Li, Ming, et autres
Publié: (2026)
When AI Navigates the Fog of War
par: Li, Ming, et autres
Publié: (2026)
par: Li, Ming, et autres
Publié: (2026)
Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning
par: Cobbina, Kwesi, et autres
Publié: (2025)
par: Cobbina, Kwesi, et autres
Publié: (2025)
Label Words as Local Task Vectors in In-Context Learning
par: Zheng, Bowen, et autres
Publié: (2024)
par: Zheng, Bowen, et autres
Publié: (2024)
CrossICL: Cross-Task In-Context Learning via Unsupervised Demonstration Transfer
par: Gao, Jinglong, et autres
Publié: (2025)
par: Gao, Jinglong, et autres
Publié: (2025)
BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law
par: Nagl, Sebastian, et autres
Publié: (2026)
par: Nagl, Sebastian, et autres
Publié: (2026)
TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice
par: Hu, Gang, et autres
Publié: (2026)
par: Hu, Gang, et autres
Publié: (2026)
PharmaShip: An Entity-Centric, Reading-Order-Supervised Benchmark for Chinese Pharmaceutical Shipping Documents
par: Xie, Tingwei, et autres
Publié: (2025)
par: Xie, Tingwei, et autres
Publié: (2025)
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
par: Xiang, Hao, et autres
Publié: (2025)
par: Xiang, Hao, et autres
Publié: (2025)
LLMsPark: A Benchmark for Evaluating Large Language Models in Strategic Gaming Contexts
par: Chen, Junhao, et autres
Publié: (2025)
par: Chen, Junhao, et autres
Publié: (2025)
TaskComplexity: A Dataset for Task Complexity Classification with In-Context Learning, FLAN-T5 and GPT-4o Benchmarks
par: Rasheed, Areeg Fahad, et autres
Publié: (2024)
par: Rasheed, Areeg Fahad, et autres
Publié: (2024)
What Happened in LLMs Layers when Trained for Fast vs. Slow Thinking: A Gradient Perspective
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
par: Adib, Shefayat E Shams, et autres
Publié: (2026)
par: Adib, Shefayat E Shams, et autres
Publié: (2026)
Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
par: Tie, Guiyao, et autres
Publié: (2025)
par: Tie, Guiyao, et autres
Publié: (2025)
Can Large Language Models Automatically Jailbreak GPT-4V?
par: Wu, Yuanwei, et autres
Publié: (2024)
par: Wu, Yuanwei, et autres
Publié: (2024)
M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language Models
par: Kwan, Wai-Chung, et autres
Publié: (2023)
par: Kwan, Wai-Chung, et autres
Publié: (2023)
EPPCMinerBen: A Novel Benchmark for Evaluating Large Language Models on Electronic Patient-Provider Communication via the Patient Portal
par: Fodeh, Samah, et autres
Publié: (2026)
par: Fodeh, Samah, et autres
Publié: (2026)
CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era
par: Shi, Kaiwen, et autres
Publié: (2026)
par: Shi, Kaiwen, et autres
Publié: (2026)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
par: Zhou, Keyan, et autres
Publié: (2025)
par: Zhou, Keyan, et autres
Publié: (2025)
CL-bench: A Benchmark for Context Learning
par: Dou, Shihan, et autres
Publié: (2026)
par: Dou, Shihan, et autres
Publié: (2026)
CCF: A Context Compression Framework for Efficient Long-Sequence Language Modeling
par: Li, Wenhao, et autres
Publié: (2025)
par: Li, Wenhao, et autres
Publié: (2025)
Open Grounded Planning: Challenges and Benchmark Construction
par: Guo, Shiguang, et autres
Publié: (2024)
par: Guo, Shiguang, et autres
Publié: (2024)
Does the Generator Mind its Contexts? An Analysis of Generative Model Faithfulness under Context Transfer
par: Hu, Xinshuo, et autres
Publié: (2024)
par: Hu, Xinshuo, et autres
Publié: (2024)
LongGenBench: Benchmarking Long-Form Generation in Long Context LLMs
par: Wu, Yuhao, et autres
Publié: (2024)
par: Wu, Yuhao, et autres
Publié: (2024)
Documents similaires
-
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
par: Fan, Chenrui, et autres
Publié: (2025) -
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
par: Sun, Ryan, et autres
Publié: (2024) -
TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning
par: Yu, Fangxu, et autres
Publié: (2025) -
GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
par: Sun, Zhouhao, et autres
Publié: (2026) -
In-Context Transfer Learning: Demonstration Synthesis by Transferring Similar Tasks
par: Wang, Dingzirui, et autres
Publié: (2024)