CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | LI, Yizhi, Zhang, Ge, Qu, Xingwei, Li, Jiali, Li, Zhaoqun, Wang, Zekun, Li, Hao, Yuan, Ruibin, Ma, Yinghao, Zhang, Kai, Zhou, Wangchunshu, Liang, Yiming, Zhang, Lei, Ma, Lei, Zhang, Jiajun, Li, Zuowen, Huang, Stephen W., Lin, Chenghua, Fu, Jie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Overview of the NLPCC 2024 Shared Task on Chinese Metaphor Generation
di: Qu, Xingwei, et al.
Pubblicazione: (2024)
di: Qu, Xingwei, et al.
Pubblicazione: (2024)
OmniBench: Towards The Future of Universal Omni-Language Models
di: Li, Yizhi, et al.
Pubblicazione: (2024)
di: Li, Yizhi, et al.
Pubblicazione: (2024)
TEGEE: Task dEfinition Guided Expert Ensembling for Generalizable and Few-shot Learning
di: Qu, Xingwei, et al.
Pubblicazione: (2024)
di: Qu, Xingwei, et al.
Pubblicazione: (2024)
CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following
di: Ma, Yinghao, et al.
Pubblicazione: (2025)
di: Ma, Yinghao, et al.
Pubblicazione: (2025)
CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
di: Zhang, Ge, et al.
Pubblicazione: (2024)
di: Zhang, Ge, et al.
Pubblicazione: (2024)
I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm
di: Liang, Yiming, et al.
Pubblicazione: (2024)
di: Liang, Yiming, et al.
Pubblicazione: (2024)
CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction
di: Ma, Yinghao, et al.
Pubblicazione: (2026)
di: Ma, Yinghao, et al.
Pubblicazione: (2026)
COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuning
di: Bai, Yuelin, et al.
Pubblicazione: (2024)
di: Bai, Yuelin, et al.
Pubblicazione: (2024)
Kun: Answer Polishment for Chinese Self-Alignment with Instruction Back-Translation
di: Zheng, Tianyu, et al.
Pubblicazione: (2024)
di: Zheng, Tianyu, et al.
Pubblicazione: (2024)
Diversity-Preserved Distribution Matching Distillation for Fast Visual Synthesis
di: Wu, Tianhe, et al.
Pubblicazione: (2026)
di: Wu, Tianhe, et al.
Pubblicazione: (2026)
LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
di: Zhuo, Le, et al.
Pubblicazione: (2023)
di: Zhuo, Le, et al.
Pubblicazione: (2023)
Aligning Instruction Tuning with Pre-training
di: Liang, Yiming, et al.
Pubblicazione: (2025)
di: Liang, Yiming, et al.
Pubblicazione: (2025)
Overview of the NLPCC 2025 Shared Task: Gender Bias Mitigation Challenge
di: Li, Yizhi, et al.
Pubblicazione: (2025)
di: Li, Yizhi, et al.
Pubblicazione: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech
di: Chen, Huakang, et al.
Pubblicazione: (2026)
di: Chen, Huakang, et al.
Pubblicazione: (2026)
Source Prompt Disentangled Inversion for Boosting Image Editability with Diffusion Models
di: Li, Ruibin, et al.
Pubblicazione: (2024)
di: Li, Ruibin, et al.
Pubblicazione: (2024)
GS-Net: Generalizable Plug-and-Play 3D Gaussian Splatting Module
di: Zhang, Yichen, et al.
Pubblicazione: (2024)
di: Zhang, Yichen, et al.
Pubblicazione: (2024)
TIIF-Bench: How Does Your T2I Model Follow Your Instructions?
di: Wei, Xinyu, et al.
Pubblicazione: (2025)
di: Wei, Xinyu, et al.
Pubblicazione: (2025)
CMDAG: A Chinese Metaphor Dataset with Annotated Grounds as CoT for Boosting Metaphor Generation
di: Shao, Yujie, et al.
Pubblicazione: (2024)
di: Shao, Yujie, et al.
Pubblicazione: (2024)
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling
di: Li, Yizhi, et al.
Pubblicazione: (2025)
di: Li, Yizhi, et al.
Pubblicazione: (2025)
Evaluating the Generalizability of LLMs in Automated Program Repair
di: Li, Fengjie, et al.
Pubblicazione: (2025)
di: Li, Fengjie, et al.
Pubblicazione: (2025)
CIF-T: A Novel CIF-based Transducer Architecture for Automatic Speech Recognition
di: Zhang, Tian-Hao, et al.
Pubblicazione: (2023)
di: Zhang, Tian-Hao, et al.
Pubblicazione: (2023)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
COIG-Writer: A High-Quality Dataset for Chinese Creative Writing with Thought Processes
di: Li, Yunwen, et al.
Pubblicazione: (2025)
di: Li, Yunwen, et al.
Pubblicazione: (2025)
First Return, Entropy-Eliciting Explore
di: Zheng, Tianyu, et al.
Pubblicazione: (2025)
di: Zheng, Tianyu, et al.
Pubblicazione: (2025)
Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements
di: Liang, Yiming, et al.
Pubblicazione: (2025)
di: Liang, Yiming, et al.
Pubblicazione: (2025)
InsViE-1M: Effective Instruction-based Video Editing with Elaborate Dataset Construction
di: Wu, Yuhui, et al.
Pubblicazione: (2025)
di: Wu, Yuhui, et al.
Pubblicazione: (2025)
RORem: Training a Robust Object Remover with Human-in-the-Loop
di: Li, Ruibin, et al.
Pubblicazione: (2025)
di: Li, Ruibin, et al.
Pubblicazione: (2025)
Deterioration of Cardiac Function Complicated by Ventricular Tachycardia After the Implantation of an Artificial Cardiac Pacemaker and Upgrading to CRT‐D: One Case Report
di: Lei Zhao, et al.
Pubblicazione: (2026)
di: Lei Zhao, et al.
Pubblicazione: (2026)
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
di: Wu, Siwei, et al.
Pubblicazione: (2024)
di: Wu, Siwei, et al.
Pubblicazione: (2024)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
di: Wang, Peiding, et al.
Pubblicazione: (2025)
di: Wang, Peiding, et al.
Pubblicazione: (2025)
Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
di: Du, Xinrun, et al.
Pubblicazione: (2024)
di: Du, Xinrun, et al.
Pubblicazione: (2024)
The Fine Line: Navigating Large Language Model Pretraining with Down-streaming Capability Analysis
di: Yang, Chen, et al.
Pubblicazione: (2024)
di: Yang, Chen, et al.
Pubblicazione: (2024)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
di: Zhang, Qian, et al.
Pubblicazione: (2024)
di: Zhang, Qian, et al.
Pubblicazione: (2024)
Steady Progress Beats Stagnation: Mutual Aid of Foundation and Conventional Models in Mixed Domain Semi-Supervised Medical Image Segmentation
di: Ma, Qinghe, et al.
Pubblicazione: (2025)
di: Ma, Qinghe, et al.
Pubblicazione: (2025)
EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation
di: Zhang, Zelin, et al.
Pubblicazione: (2025)
di: Zhang, Zelin, et al.
Pubblicazione: (2025)
LIFEBench: Evaluating Length Instruction Following in Large Language Models
di: Zhang, Wei, et al.
Pubblicazione: (2025)
di: Zhang, Wei, et al.
Pubblicazione: (2025)
LongEval: A Comprehensive Analysis of Long-Text Generation Through a Plan-based Paradigm
di: Wu, Siwei, et al.
Pubblicazione: (2025)
di: Wu, Siwei, et al.
Pubblicazione: (2025)
M-CIF: Multi-Scale Alignment For CIF-Based Non-Autoregressive ASR
di: Mao, Ruixiang, et al.
Pubblicazione: (2025)
di: Mao, Ruixiang, et al.
Pubblicazione: (2025)
Impact of exercise intervention with or without curcumin supplementation on body fat composition, glucose, and lipid metabolism in obese adults: A meta‐analysis
di: Yinghao Li, et al.
Pubblicazione: (2024)
di: Yinghao Li, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Overview of the NLPCC 2024 Shared Task on Chinese Metaphor Generation
di: Qu, Xingwei, et al.
Pubblicazione: (2024) -
OmniBench: Towards The Future of Universal Omni-Language Models
di: Li, Yizhi, et al.
Pubblicazione: (2024) -
TEGEE: Task dEfinition Guided Expert Ensembling for Generalizable and Few-shot Learning
di: Qu, Xingwei, et al.
Pubblicazione: (2024) -
CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following
di: Ma, Yinghao, et al.
Pubblicazione: (2025) -
CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
di: Zhang, Ge, et al.
Pubblicazione: (2024)