Evaluating LLMs on Chinese Topic Constructions: A Research Proposal Inspired by Tian et al. (2024)
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Yang, Xiaodong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating LLMs on Chinese Idiom Translation
par: Yang, Cai, et autres
Publié: (2025)
par: Yang, Cai, et autres
Publié: (2025)
Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination
par: Gao, Lirong, et autres
Publié: (2026)
par: Gao, Lirong, et autres
Publié: (2026)
A Topic-aware Comparable Corpus of Chinese Variations
par: Lian, Da-Chen, et autres
Publié: (2024)
par: Lian, Da-Chen, et autres
Publié: (2024)
The performances of the Chinese and U.S. Large Language Models on the Topic of Chinese Culture
par: Liu, Feiyan, et autres
Publié: (2026)
par: Liu, Feiyan, et autres
Publié: (2026)
TianHui: A Domain-Specific Large Language Model for Diverse Traditional Chinese Medicine Scenarios
par: Yin, Ji, et autres
Publié: (2025)
par: Yin, Ji, et autres
Publié: (2025)
TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue Summarization
par: Tang, Liyan, et autres
Publié: (2024)
par: Tang, Liyan, et autres
Publié: (2024)
Unveiling the Competitive Dynamics: A Comparative Evaluation of American and Chinese LLMs
par: Jiang, Zhenhui, et autres
Publié: (2024)
par: Jiang, Zhenhui, et autres
Publié: (2024)
Interdisciplinary Fairness in Imbalanced Research Proposal Topic Inference: A Hierarchical Transformer-based Method with Selective Interpolation
par: Xiao, Meng, et autres
Publié: (2023)
par: Xiao, Meng, et autres
Publié: (2023)
Proposal Report for the 2nd SciCAP Competition 2024
par: Li, Pengpeng, et autres
Publié: (2024)
par: Li, Pengpeng, et autres
Publié: (2024)
Addressing Topic Leakage in Cross-Topic Evaluation for Authorship Verification
par: Sawatphol, Jitkapat, et autres
Publié: (2024)
par: Sawatphol, Jitkapat, et autres
Publié: (2024)
Topic-Controllable Summarization: Topic-Aware Evaluation and Transformer Methods
par: Passali, Tatiana, et autres
Publié: (2022)
par: Passali, Tatiana, et autres
Publié: (2022)
ClinConsensus: A Physician-Calibrated Benchmark for Evaluating Clinical Rubric Coverage in Chinese Medical LLMs
par: Zheng, Xiang, et autres
Publié: (2026)
par: Zheng, Xiang, et autres
Publié: (2026)
Evaluating Distributed Representations for Multi-Level Lexical Semantics: A Research Proposal
par: Liu, Zhu
Publié: (2024)
par: Liu, Zhu
Publié: (2024)
WHBench: Evaluating Frontier LLMs with Expert-in-the-Loop Validation on Women's Health Topics
par: Maurya, Sneha, et autres
Publié: (2026)
par: Maurya, Sneha, et autres
Publié: (2026)
Proposing Topic Models and Evaluation Frameworks for Analyzing Associations with External Outcomes: An Application to Leadership Analysis Using Large-Scale Corporate Review Data
par: Yoshida, Yura, et autres
Publié: (2026)
par: Yoshida, Yura, et autres
Publié: (2026)
LLMs Are Not Intelligent Thinkers: Introducing Mathematical Topic Tree Benchmark for Comprehensive Evaluation of LLMs
par: Davoodi, Arash Gholami, et autres
Publié: (2024)
par: Davoodi, Arash Gholami, et autres
Publié: (2024)
Advancing Topic Segmentation and Outline Generation in Chinese Texts: The Paragraph-level Topic Representation, Corpus, and Benchmark
par: Jiang, Feng, et autres
Publié: (2023)
par: Jiang, Feng, et autres
Publié: (2023)
Context is Key(NMF): Modelling Topical Information Dynamics in Chinese Diaspora Media
par: Kristensen-McLachlan, Ross Deans, et autres
Publié: (2024)
par: Kristensen-McLachlan, Ross Deans, et autres
Publié: (2024)
Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge
par: Cai, Yunna, et autres
Publié: (2025)
par: Cai, Yunna, et autres
Publié: (2025)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
par: Zhang, Hengxiang, et autres
Publié: (2024)
par: Zhang, Hengxiang, et autres
Publié: (2024)
CDTP: A Large-Scale Chinese Data-Text Pair Dataset for Comprehensive Evaluation of Chinese LLMs
par: Wu, Chengwei, et autres
Publié: (2025)
par: Wu, Chengwei, et autres
Publié: (2025)
NaturalConv: A Chinese Dialogue Dataset Towards Multi-turn Topic-driven Conversation
par: Wang, Xiaoyang, et autres
Publié: (2021)
par: Wang, Xiaoyang, et autres
Publié: (2021)
CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns
par: Zhou, Zhenhong, et autres
Publié: (2026)
par: Zhou, Zhenhong, et autres
Publié: (2026)
Can AI Write Classical Chinese Poetry like Humans? An Empirical Study Inspired by Turing Test
par: Deng, Zekun, et autres
Publié: (2024)
par: Deng, Zekun, et autres
Publié: (2024)
Holistic Evaluations of Topic Models
par: Compton, Thomas
Publié: (2025)
par: Compton, Thomas
Publié: (2025)
QualBench: Benchmarking Chinese LLMs with Localized Professional Qualifications for Vertical Domain Evaluation
par: Hong, Mengze, et autres
Publié: (2025)
par: Hong, Mengze, et autres
Publié: (2025)
Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarization
par: Li, Chuyuan, et autres
Publié: (2025)
par: Li, Chuyuan, et autres
Publié: (2025)
Analyzing Cancer Patients' Experiences with Embedding-based Topic Modeling and LLMs
par: Ionescu, Teodor-Călin, et autres
Publié: (2026)
par: Ionescu, Teodor-Călin, et autres
Publié: (2026)
Hierarchical Graph Topic Modeling with Topic Tree-based Transformer
par: Zhang, Delvin Ce, et autres
Publié: (2025)
par: Zhang, Delvin Ce, et autres
Publié: (2025)
Assisting Research Proposal Writing with Large Language Models: Evaluation and Refinement
par: Ren, Jing, et autres
Publié: (2025)
par: Ren, Jing, et autres
Publié: (2025)
Automatic Construction of Chinese Verb Collostruction Database
par: Tang, Xuri, et autres
Publié: (2025)
par: Tang, Xuri, et autres
Publié: (2025)
Topic Modeling with Fine-tuning LLMs and Bag of Sentences
par: Schneider, Johannes
Publié: (2024)
par: Schneider, Johannes
Publié: (2024)
Comprehensive Evaluation of Large Language Models for Topic Modeling
par: Doi, Tomoki, et autres
Publié: (2024)
par: Doi, Tomoki, et autres
Publié: (2024)
Are LLMs Effective Backbones for Fine-tuning? An Experimental Investigation of Supervised LLMs on Chinese Short Text Matching
par: Liu, Shulin, et autres
Publié: (2024)
par: Liu, Shulin, et autres
Publié: (2024)
TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice
par: Hu, Gang, et autres
Publié: (2026)
par: Hu, Gang, et autres
Publié: (2026)
LLM Reading Tea Leaves: Automatically Evaluating Topic Models with Large Language Models
par: Yang, Xiaohao, et autres
Publié: (2024)
par: Yang, Xiaohao, et autres
Publié: (2024)
Evaluating CxG Generalisation in LLMs via Construction-Based NLI Fine Tuning
par: Mackintosh, Tom, et autres
Publié: (2025)
par: Mackintosh, Tom, et autres
Publié: (2025)
A Neural Topic Method Using a Large-Language-Model-in-the-Loop for Business Research
par: Ludwig, Stephan, et autres
Publié: (2026)
par: Ludwig, Stephan, et autres
Publié: (2026)
TopicGPT: A Prompt-based Topic Modeling Framework
par: Pham, Chau Minh, et autres
Publié: (2023)
par: Pham, Chau Minh, et autres
Publié: (2023)
DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
Documents similaires
-
Evaluating LLMs on Chinese Idiom Translation
par: Yang, Cai, et autres
Publié: (2025) -
Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination
par: Gao, Lirong, et autres
Publié: (2026) -
A Topic-aware Comparable Corpus of Chinese Variations
par: Lian, Da-Chen, et autres
Publié: (2024) -
The performances of the Chinese and U.S. Large Language Models on the Topic of Chinese Culture
par: Liu, Feiyan, et autres
Publié: (2026) -
TianHui: A Domain-Specific Large Language Model for Diverse Traditional Chinese Medicine Scenarios
par: Yin, Ji, et autres
Publié: (2025)