Code-Based English Models Surprising Performance on Chinese QA Pair Extraction Task
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Linghan, Liu, Hui, Lin, Xiaojun, Dong, Jiayuan, Sheng, Yue, Shi, Gang, Liu, Zhiwei, Chen, Hongwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
por: He, Yancheng, et al.
Publicado: (2024)
por: He, Yancheng, et al.
Publicado: (2024)
FunQA: Towards Surprising Video Comprehension
por: Xie, Binzhu, et al.
Publicado: (2023)
por: Xie, Binzhu, et al.
Publicado: (2023)
StorySparkQA: Expert-Annotated QA Pairs with Real-World Knowledge for Children's Story-Based Learning
por: Chen, Jiaju, et al.
Publicado: (2023)
por: Chen, Jiaju, et al.
Publicado: (2023)
Towards Better Question Generation in QA-based Event Extraction
por: Hong, Zijin, et al.
Publicado: (2024)
por: Hong, Zijin, et al.
Publicado: (2024)
Assessing the Performance of Chinese Open Source Large Language Models in Information Extraction Tasks
por: Cai, Yida, et al.
Publicado: (2024)
por: Cai, Yida, et al.
Publicado: (2024)
CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models
por: Lin, Hong Yi, et al.
Publicado: (2025)
por: Lin, Hong Yi, et al.
Publicado: (2025)
MT-RewardTree: A Comprehensive Framework for Advancing LLM-Based Machine Translation via Reward Modeling
por: Feng, Zhaopeng, et al.
Publicado: (2025)
por: Feng, Zhaopeng, et al.
Publicado: (2025)
A Question Answering Based Pipeline for Comprehensive Chinese EHR Information Extraction
por: Ying, Huaiyuan, et al.
Publicado: (2024)
por: Ying, Huaiyuan, et al.
Publicado: (2024)
CodeSimpleQA: Scaling Factuality in Code Large Language Models
por: Yang, Jian, et al.
Publicado: (2025)
por: Yang, Jian, et al.
Publicado: (2025)
Clinical QA 2.0: Multi-Task Learning for Answer Extraction and Categorization
por: Pattnayak, Priyaranjan, et al.
Publicado: (2025)
por: Pattnayak, Priyaranjan, et al.
Publicado: (2025)
ChineseEcomQA: A Scalable E-commerce Concept Evaluation Benchmark for Large Language Models
por: Chen, Haibin, et al.
Publicado: (2025)
por: Chen, Haibin, et al.
Publicado: (2025)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
por: Tan, Yingshui, et al.
Publicado: (2024)
por: Tan, Yingshui, et al.
Publicado: (2024)
Enhancing Pre-Trained Generative Language Models with Question Attended Span Extraction on Machine Reading Comprehension
por: Ai, Lin, et al.
Publicado: (2024)
por: Ai, Lin, et al.
Publicado: (2024)
Benchmarking Chinese Medical LLMs: A Medbench-based Analysis of Performance Gaps and Hierarchical Optimization Strategies
por: Jiang, Luyi, et al.
Publicado: (2025)
por: Jiang, Luyi, et al.
Publicado: (2025)
Semantic Reformulation Entropy for Robust Hallucination Detection in QA Tasks
por: Tong, Chaodong, et al.
Publicado: (2025)
por: Tong, Chaodong, et al.
Publicado: (2025)
RJUA-QA: A Comprehensive QA Dataset for Urology
por: Lyu, Shiwei, et al.
Publicado: (2023)
por: Lyu, Shiwei, et al.
Publicado: (2023)
ExpertGenQA: Open-ended QA generation in Specialized Domains
por: Shahgir, Haz Sameen, et al.
Publicado: (2025)
por: Shahgir, Haz Sameen, et al.
Publicado: (2025)
SWE-QA: Can Language Models Answer Repository-level Code Questions?
por: Peng, Weihan, et al.
Publicado: (2025)
por: Peng, Weihan, et al.
Publicado: (2025)
Extending Minimal Pairs with Ordinal Surprisal Curves and Entropy Across Applied Domains
por: Katz, Andrew
Publicado: (2026)
por: Katz, Andrew
Publicado: (2026)
ChiMDQA: Towards Comprehensive Chinese Document QA with Fine-grained Evaluation
por: Gao, Jing, et al.
Publicado: (2025)
por: Gao, Jing, et al.
Publicado: (2025)
Self-Evolving LLM Memory Extraction Across Heterogeneous Tasks
por: Yang, Yuqing, et al.
Publicado: (2026)
por: Yang, Yuqing, et al.
Publicado: (2026)
Minimal Pair-Based Evaluation of Code-Switching
por: Sterner, Igor, et al.
Publicado: (2025)
por: Sterner, Igor, et al.
Publicado: (2025)
MEKiT: Multi-source Heterogeneous Knowledge Injection Method via Instruction Tuning for Emotion-Cause Pair Extraction
por: Mu, Shiyi, et al.
Publicado: (2025)
por: Mu, Shiyi, et al.
Publicado: (2025)
LexRel: Benchmarking Legal Relation Extraction for Chinese Civil Cases
por: Cai, Yida, et al.
Publicado: (2025)
por: Cai, Yida, et al.
Publicado: (2025)
Test-Time Code-Switching for Cross-lingual Aspect Sentiment Triplet Extraction
por: Sheng, Dongming, et al.
Publicado: (2025)
por: Sheng, Dongming, et al.
Publicado: (2025)
Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark
por: Zheng, Dewu, et al.
Publicado: (2024)
por: Zheng, Dewu, et al.
Publicado: (2024)
Expect the Unexpected? Testing the Surprisal of Salient Entities
por: Lin, Jessica, et al.
Publicado: (2026)
por: Lin, Jessica, et al.
Publicado: (2026)
PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
por: Zhang, Huixuan, et al.
Publicado: (2024)
por: Zhang, Huixuan, et al.
Publicado: (2024)
SCRIBES: Web-Scale Script-Based Semi-Structured Data Extraction with Reinforcement Learning
por: Liu, Shicheng, et al.
Publicado: (2025)
por: Liu, Shicheng, et al.
Publicado: (2025)
Memory-QA: Answering Recall Questions Based on Multimodal Memories
por: Jiang, Hongda, et al.
Publicado: (2025)
por: Jiang, Hongda, et al.
Publicado: (2025)
HardMTBench: Stress-Testing Chinese-English Translation on Knowledge-Intensive Domains
por: Li, Zheng, et al.
Publicado: (2026)
por: Li, Zheng, et al.
Publicado: (2026)
RepoQA: Evaluating Long Context Code Understanding
por: Liu, Jiawei, et al.
Publicado: (2024)
por: Liu, Jiawei, et al.
Publicado: (2024)
PEneo: Unifying Line Extraction, Line Grouping, and Entity Linking for End-to-end Document Pair Extraction
por: Lin, Zening, et al.
Publicado: (2024)
por: Lin, Zening, et al.
Publicado: (2024)
MSG-Chart: Multimodal Scene Graph for ChartQA
por: Dai, Yue, et al.
Publicado: (2024)
por: Dai, Yue, et al.
Publicado: (2024)
Keyword Extraction, and Aspect Classification in Sinhala, English, and Code-Mixed Content
por: Rizvi, F. A., et al.
Publicado: (2025)
por: Rizvi, F. A., et al.
Publicado: (2025)
Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation
por: Chen, Le, et al.
Publicado: (2025)
por: Chen, Le, et al.
Publicado: (2025)
RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering
por: Hudspeth, Marisa, et al.
Publicado: (2026)
por: Hudspeth, Marisa, et al.
Publicado: (2026)
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
por: Shafayat, Sheikh, et al.
Publicado: (2024)
por: Shafayat, Sheikh, et al.
Publicado: (2024)
LyS at SemEval 2025 Task 8: Zero-Shot Code Generation for Tabular QA
por: Gude, Adrián, et al.
Publicado: (2025)
por: Gude, Adrián, et al.
Publicado: (2025)
Multilingual Open QA on the MIA Shared Task
por: Yarrabelly, Navya, et al.
Publicado: (2025)
por: Yarrabelly, Navya, et al.
Publicado: (2025)
Ejemplares similares
-
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
por: He, Yancheng, et al.
Publicado: (2024) -
FunQA: Towards Surprising Video Comprehension
por: Xie, Binzhu, et al.
Publicado: (2023) -
StorySparkQA: Expert-Annotated QA Pairs with Real-World Knowledge for Children's Story-Based Learning
por: Chen, Jiaju, et al.
Publicado: (2023) -
Towards Better Question Generation in QA-based Event Extraction
por: Hong, Zijin, et al.
Publicado: (2024) -
Assessing the Performance of Chinese Open Source Large Language Models in Information Extraction Tasks
por: Cai, Yida, et al.
Publicado: (2024)