Code-Based English Models Surprising Performance on Chinese QA Pair Extraction Task
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Linghan, Liu, Hui, Lin, Xiaojun, Dong, Jiayuan, Sheng, Yue, Shi, Gang, Liu, Zhiwei, Chen, Hongwei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
by: He, Yancheng, et al.
Published: (2024)
by: He, Yancheng, et al.
Published: (2024)
FunQA: Towards Surprising Video Comprehension
by: Xie, Binzhu, et al.
Published: (2023)
by: Xie, Binzhu, et al.
Published: (2023)
StorySparkQA: Expert-Annotated QA Pairs with Real-World Knowledge for Children's Story-Based Learning
by: Chen, Jiaju, et al.
Published: (2023)
by: Chen, Jiaju, et al.
Published: (2023)
Towards Better Question Generation in QA-based Event Extraction
by: Hong, Zijin, et al.
Published: (2024)
by: Hong, Zijin, et al.
Published: (2024)
Assessing the Performance of Chinese Open Source Large Language Models in Information Extraction Tasks
by: Cai, Yida, et al.
Published: (2024)
by: Cai, Yida, et al.
Published: (2024)
CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models
by: Lin, Hong Yi, et al.
Published: (2025)
by: Lin, Hong Yi, et al.
Published: (2025)
MT-RewardTree: A Comprehensive Framework for Advancing LLM-Based Machine Translation via Reward Modeling
by: Feng, Zhaopeng, et al.
Published: (2025)
by: Feng, Zhaopeng, et al.
Published: (2025)
A Question Answering Based Pipeline for Comprehensive Chinese EHR Information Extraction
by: Ying, Huaiyuan, et al.
Published: (2024)
by: Ying, Huaiyuan, et al.
Published: (2024)
CodeSimpleQA: Scaling Factuality in Code Large Language Models
by: Yang, Jian, et al.
Published: (2025)
by: Yang, Jian, et al.
Published: (2025)
Clinical QA 2.0: Multi-Task Learning for Answer Extraction and Categorization
by: Pattnayak, Priyaranjan, et al.
Published: (2025)
by: Pattnayak, Priyaranjan, et al.
Published: (2025)
ChineseEcomQA: A Scalable E-commerce Concept Evaluation Benchmark for Large Language Models
by: Chen, Haibin, et al.
Published: (2025)
by: Chen, Haibin, et al.
Published: (2025)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
by: Tan, Yingshui, et al.
Published: (2024)
by: Tan, Yingshui, et al.
Published: (2024)
Enhancing Pre-Trained Generative Language Models with Question Attended Span Extraction on Machine Reading Comprehension
by: Ai, Lin, et al.
Published: (2024)
by: Ai, Lin, et al.
Published: (2024)
Benchmarking Chinese Medical LLMs: A Medbench-based Analysis of Performance Gaps and Hierarchical Optimization Strategies
by: Jiang, Luyi, et al.
Published: (2025)
by: Jiang, Luyi, et al.
Published: (2025)
Semantic Reformulation Entropy for Robust Hallucination Detection in QA Tasks
by: Tong, Chaodong, et al.
Published: (2025)
by: Tong, Chaodong, et al.
Published: (2025)
RJUA-QA: A Comprehensive QA Dataset for Urology
by: Lyu, Shiwei, et al.
Published: (2023)
by: Lyu, Shiwei, et al.
Published: (2023)
ExpertGenQA: Open-ended QA generation in Specialized Domains
by: Shahgir, Haz Sameen, et al.
Published: (2025)
by: Shahgir, Haz Sameen, et al.
Published: (2025)
SWE-QA: Can Language Models Answer Repository-level Code Questions?
by: Peng, Weihan, et al.
Published: (2025)
by: Peng, Weihan, et al.
Published: (2025)
Extending Minimal Pairs with Ordinal Surprisal Curves and Entropy Across Applied Domains
by: Katz, Andrew
Published: (2026)
by: Katz, Andrew
Published: (2026)
ChiMDQA: Towards Comprehensive Chinese Document QA with Fine-grained Evaluation
by: Gao, Jing, et al.
Published: (2025)
by: Gao, Jing, et al.
Published: (2025)
Self-Evolving LLM Memory Extraction Across Heterogeneous Tasks
by: Yang, Yuqing, et al.
Published: (2026)
by: Yang, Yuqing, et al.
Published: (2026)
Minimal Pair-Based Evaluation of Code-Switching
by: Sterner, Igor, et al.
Published: (2025)
by: Sterner, Igor, et al.
Published: (2025)
MEKiT: Multi-source Heterogeneous Knowledge Injection Method via Instruction Tuning for Emotion-Cause Pair Extraction
by: Mu, Shiyi, et al.
Published: (2025)
by: Mu, Shiyi, et al.
Published: (2025)
LexRel: Benchmarking Legal Relation Extraction for Chinese Civil Cases
by: Cai, Yida, et al.
Published: (2025)
by: Cai, Yida, et al.
Published: (2025)
Test-Time Code-Switching for Cross-lingual Aspect Sentiment Triplet Extraction
by: Sheng, Dongming, et al.
Published: (2025)
by: Sheng, Dongming, et al.
Published: (2025)
Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark
by: Zheng, Dewu, et al.
Published: (2024)
by: Zheng, Dewu, et al.
Published: (2024)
Expect the Unexpected? Testing the Surprisal of Salient Entities
by: Lin, Jessica, et al.
Published: (2026)
by: Lin, Jessica, et al.
Published: (2026)
PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
by: Zhang, Huixuan, et al.
Published: (2024)
by: Zhang, Huixuan, et al.
Published: (2024)
SCRIBES: Web-Scale Script-Based Semi-Structured Data Extraction with Reinforcement Learning
by: Liu, Shicheng, et al.
Published: (2025)
by: Liu, Shicheng, et al.
Published: (2025)
Memory-QA: Answering Recall Questions Based on Multimodal Memories
by: Jiang, Hongda, et al.
Published: (2025)
by: Jiang, Hongda, et al.
Published: (2025)
HardMTBench: Stress-Testing Chinese-English Translation on Knowledge-Intensive Domains
by: Li, Zheng, et al.
Published: (2026)
by: Li, Zheng, et al.
Published: (2026)
RepoQA: Evaluating Long Context Code Understanding
by: Liu, Jiawei, et al.
Published: (2024)
by: Liu, Jiawei, et al.
Published: (2024)
PEneo: Unifying Line Extraction, Line Grouping, and Entity Linking for End-to-end Document Pair Extraction
by: Lin, Zening, et al.
Published: (2024)
by: Lin, Zening, et al.
Published: (2024)
MSG-Chart: Multimodal Scene Graph for ChartQA
by: Dai, Yue, et al.
Published: (2024)
by: Dai, Yue, et al.
Published: (2024)
Keyword Extraction, and Aspect Classification in Sinhala, English, and Code-Mixed Content
by: Rizvi, F. A., et al.
Published: (2025)
by: Rizvi, F. A., et al.
Published: (2025)
Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation
by: Chen, Le, et al.
Published: (2025)
by: Chen, Le, et al.
Published: (2025)
RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering
by: Hudspeth, Marisa, et al.
Published: (2026)
by: Hudspeth, Marisa, et al.
Published: (2026)
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
by: Shafayat, Sheikh, et al.
Published: (2024)
by: Shafayat, Sheikh, et al.
Published: (2024)
LyS at SemEval 2025 Task 8: Zero-Shot Code Generation for Tabular QA
by: Gude, Adrián, et al.
Published: (2025)
by: Gude, Adrián, et al.
Published: (2025)
Multilingual Open QA on the MIA Shared Task
by: Yarrabelly, Navya, et al.
Published: (2025)
by: Yarrabelly, Navya, et al.
Published: (2025)
Similar Items
-
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
by: He, Yancheng, et al.
Published: (2024) -
FunQA: Towards Surprising Video Comprehension
by: Xie, Binzhu, et al.
Published: (2023) -
StorySparkQA: Expert-Annotated QA Pairs with Real-World Knowledge for Children's Story-Based Learning
by: Chen, Jiaju, et al.
Published: (2023) -
Towards Better Question Generation in QA-based Event Extraction
by: Hong, Zijin, et al.
Published: (2024) -
Assessing the Performance of Chinese Open Source Large Language Models in Information Extraction Tasks
by: Cai, Yida, et al.
Published: (2024)