Developing and Utilizing a Large-Scale Cantonese Dataset for Multi-Tasking in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Jiyue, Truong, Alfred Kar Yin, Chen, Yanyu, Bao, Qinghang, Wang, Sheng, Chen, Pengan, Wang, Jiuming, Kong, Lingpeng, Li, Yu, Wu, Chuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Well Do LLMs Handle Cantonese? Benchmarking Cantonese Capabilities of Large Language Models
par: Jiang, Jiyue, et autres
Publié: (2024)
par: Jiang, Jiyue, et autres
Publié: (2024)
MoS: Unleashing Parameter Efficiency of Low-Rank Adaptation with Mixture of Shards
par: Wang, Sheng, et autres
Publié: (2024)
par: Wang, Sheng, et autres
Publié: (2024)
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
par: Jiang, Jiyue, et autres
Publié: (2025)
par: Jiang, Jiyue, et autres
Publié: (2025)
Data Augmentation of Multi-turn Psychological Dialogue via Knowledge-driven Progressive Thought Prompting
par: Jiang, Jiyue, et autres
Publié: (2024)
par: Jiang, Jiyue, et autres
Publié: (2024)
LoRA Meets Dropout under a Unified Framework
par: Wang, Sheng, et autres
Publié: (2024)
par: Wang, Sheng, et autres
Publié: (2024)
Large Language Models in Bioinformatics: A Survey
par: Wang, Zhenyu, et autres
Publié: (2025)
par: Wang, Zhenyu, et autres
Publié: (2025)
TreeSynth: Synthesizing Diverse Data from Scratch via Tree-Guided Subspace Partitioning
par: Wang, Sheng, et autres
Publié: (2025)
par: Wang, Sheng, et autres
Publié: (2025)
PRoLoRA: Partial Rotation Empowers More Parameter-Efficient LoRA
par: Wang, Sheng, et autres
Publié: (2024)
par: Wang, Sheng, et autres
Publié: (2024)
ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdom
par: Zhou, Jingqi, et autres
Publié: (2024)
par: Zhou, Jingqi, et autres
Publié: (2024)
A Principle-Driven Adaptive Policy for Group Cognitive Stimulation Dialogue for Elderly with Cognitive Impairment
par: Jiang, Jiyue, et autres
Publié: (2026)
par: Jiang, Jiyue, et autres
Publié: (2026)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Emergent Adaptation
par: Zhou, Jingqi, et autres
Publié: (2026)
par: Zhou, Jingqi, et autres
Publié: (2026)
Exploring the Reliability of Large Language Models as Customized Evaluators for Diverse NLP Tasks
par: Li, Qintong, et autres
Publié: (2023)
par: Li, Qintong, et autres
Publié: (2023)
WenetSpeech-Yue: A Large-scale Cantonese Speech Corpus with Multi-dimensional Annotation
par: Li, Longhao, et autres
Publié: (2025)
par: Li, Longhao, et autres
Publié: (2025)
QSpec: Speculative Decoding with Complementary Quantization Schemes
par: Zhao, Juntao, et autres
Publié: (2024)
par: Zhao, Juntao, et autres
Publié: (2024)
A Large-Scale Study on Video Action Dataset Condensation
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
ML-Mamba: Efficient Multi-Modal Large Language Model Utilizing Mamba-2
par: Huang, Wenjun, et autres
Publié: (2024)
par: Huang, Wenjun, et autres
Publié: (2024)
PromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model Reasoning
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents
par: Chen, Yanyu, et autres
Publié: (2026)
par: Chen, Yanyu, et autres
Publié: (2026)
Training-Free Long-Context Scaling of Large Language Models
par: An, Chenxin, et autres
Publié: (2024)
par: An, Chenxin, et autres
Publié: (2024)
Scaling Reasoning without Attention
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
GaN nanowires and nanotubes growth by chemical vapor deposition method at different NH3 flow rate
par: Pengan Li
Publié: (2016)
par: Pengan Li
Publié: (2016)
GUIDE: A Global Unified Inference Engine for Deploying Large Language Models in Heterogeneous Environments
par: Chen, Yanyu, et autres
Publié: (2024)
par: Chen, Yanyu, et autres
Publié: (2024)
DS-ProGen: A Dual-Structure Deep Language Model for Functional Protein Design
par: Li, Yanting, et autres
Publié: (2025)
par: Li, Yanting, et autres
Publié: (2025)
MUD: Towards a Large-Scale and Noise-Filtered UI Dataset for Modern Style UI Modeling
par: Feng, Sidong, et autres
Publié: (2024)
par: Feng, Sidong, et autres
Publié: (2024)
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
Mol-Instructions: A Large-Scale Biomolecular Instruction Dataset for Large Language Models
par: Fang, Yin, et autres
Publié: (2023)
par: Fang, Yin, et autres
Publié: (2023)
SwitchLingua: The First Large-Scale Multilingual and Multi-Ethnic Code-Switching Dataset
par: Xie, Peng, et autres
Publié: (2025)
par: Xie, Peng, et autres
Publié: (2025)
$\mathtt{M^3VIR}$: A Large-Scale Multi-Modality Multi-View Synthesized Benchmark Dataset for Image Restoration and Content Creation
par: Li, Yuanzhi, et autres
Publié: (2025)
par: Li, Yuanzhi, et autres
Publié: (2025)
DynaAct: Large Language Model Reasoning with Dynamic Action Spaces
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
Understanding Bias in Large-Scale Visual Datasets
par: Zeng, Boya, et autres
Publié: (2024)
par: Zeng, Boya, et autres
Publié: (2024)
Design and Implementation of a Lightweight Object Detection System for Resource-Constrained Edge Environments
par: Jiang, Jiyue, et autres
Publié: (2025)
par: Jiang, Jiyue, et autres
Publié: (2025)
Advancing Oyster Phenotype Segmentation with Multi-Network Ensemble and Multi-Scale mechanism
par: Yang, Wenli, et autres
Publié: (2025)
par: Yang, Wenli, et autres
Publié: (2025)
ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models
par: Qin, Chonghan, et autres
Publié: (2026)
par: Qin, Chonghan, et autres
Publié: (2026)
LMVD: A Large-Scale Multimodal Vlog Dataset for Depression Detection in the Wild
par: He, Lang, et autres
Publié: (2024)
par: He, Lang, et autres
Publié: (2024)
Scale Efficient Training for Large Datasets
par: Zhou, Qing, et autres
Publié: (2025)
par: Zhou, Qing, et autres
Publié: (2025)
SwarmPRM: Probabilistic Roadmap Motion Planning for Large-Scale Swarm Robotic Systems
par: Hu, Yunze, et autres
Publié: (2024)
par: Hu, Yunze, et autres
Publié: (2024)
Forewarned is Forearmed: Leveraging LLMs for Data Synthesis through Failure-Inducing Exploration
par: Li, Qintong, et autres
Publié: (2024)
par: Li, Qintong, et autres
Publié: (2024)
JMultiWOZ: A Large-Scale Japanese Multi-Domain Task-Oriented Dialogue Dataset
par: Ohashi, Atsumoto, et autres
Publié: (2024)
par: Ohashi, Atsumoto, et autres
Publié: (2024)
Documents similaires
-
How Well Do LLMs Handle Cantonese? Benchmarking Cantonese Capabilities of Large Language Models
par: Jiang, Jiyue, et autres
Publié: (2024) -
MoS: Unleashing Parameter Efficiency of Low-Rank Adaptation with Mixture of Shards
par: Wang, Sheng, et autres
Publié: (2024) -
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
par: Jiang, Jiyue, et autres
Publié: (2025) -
Data Augmentation of Multi-turn Psychological Dialogue via Knowledge-driven Progressive Thought Prompting
par: Jiang, Jiyue, et autres
Publié: (2024) -
LoRA Meets Dropout under a Unified Framework
par: Wang, Sheng, et autres
Publié: (2024)