FineFreq: A Multilingual Character Frequency Dataset from Web-Scale Text
Fuente:
arXiv
Salvato in:
| Autore principale: | Xu, Binbin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale
di: Penedo, Guilherme, et al.
Pubblicazione: (2024)
di: Penedo, Guilherme, et al.
Pubblicazione: (2024)
Text2Freq: Learning Series Patterns from Text via Frequency Domain
di: Lo, Ming-Chih, et al.
Pubblicazione: (2024)
di: Lo, Ming-Chih, et al.
Pubblicazione: (2024)
FreqMark: Frequency-Based Watermark for Sentence-Level Detection of LLM-Generated Text
di: Xu, Zhenyu, et al.
Pubblicazione: (2024)
di: Xu, Zhenyu, et al.
Pubblicazione: (2024)
FreqKV: Key-Value Compression in Frequency Domain for Context Window Extension
di: Kai, Jushi, et al.
Pubblicazione: (2025)
di: Kai, Jushi, et al.
Pubblicazione: (2025)
UltraLink: An Open-Source Knowledge-Enhanced Multilingual Supervised Fine-tuning Dataset
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
Taxi1500: A Multilingual Dataset for Text Classification in 1500 Languages
di: Ma, Chunlan, et al.
Pubblicazione: (2023)
di: Ma, Chunlan, et al.
Pubblicazione: (2023)
WebQAmGaze: A Multilingual Webcam Eye-Tracking-While-Reading Dataset
di: Ribeiro, Tiago, et al.
Pubblicazione: (2023)
di: Ribeiro, Tiago, et al.
Pubblicazione: (2023)
Multilingual Text Style Transfer: Datasets & Models for Indian Languages
di: Mukherjee, Sourabrata, et al.
Pubblicazione: (2024)
di: Mukherjee, Sourabrata, et al.
Pubblicazione: (2024)
FineWeb-zhtw: Scalable Curation of Traditional Chinese Text Data from the Web
di: Lin, Cheng-Wei, et al.
Pubblicazione: (2024)
di: Lin, Cheng-Wei, et al.
Pubblicazione: (2024)
Efficiently Identifying Low-Quality Language Subsets in Multilingual Datasets: A Case Study on a Large-Scale Multilingual Audio Dataset
di: Samir, Farhan, et al.
Pubblicazione: (2024)
di: Samir, Farhan, et al.
Pubblicazione: (2024)
SIFT-50M: A Large-Scale Multilingual Dataset for Speech Instruction Fine-Tuning
di: Pandey, Prabhat, et al.
Pubblicazione: (2025)
di: Pandey, Prabhat, et al.
Pubblicazione: (2025)
M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets
di: Zhao, Chunguang, et al.
Pubblicazione: (2025)
di: Zhao, Chunguang, et al.
Pubblicazione: (2025)
Scale-free Characteristics of Multilingual Legal Texts and the Limitations of LLMs
di: Chen, Haoyang, et al.
Pubblicazione: (2025)
di: Chen, Haoyang, et al.
Pubblicazione: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
di: Atuhurra, Jesse, et al.
Pubblicazione: (2024)
di: Atuhurra, Jesse, et al.
Pubblicazione: (2024)
Test-Time Scaling with Repeated Sampling Improves Multilingual Text Generation
di: Gupta, Ashim, et al.
Pubblicazione: (2025)
di: Gupta, Ashim, et al.
Pubblicazione: (2025)
Increasing the Robustness of the Fine-tuned Multilingual Machine-Generated Text Detectors
di: Macko, Dominik, et al.
Pubblicazione: (2025)
di: Macko, Dominik, et al.
Pubblicazione: (2025)
Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset (GIST)
di: Liu, Jiarui, et al.
Pubblicazione: (2024)
di: Liu, Jiarui, et al.
Pubblicazione: (2024)
CHATTER: A Character Attribution Dataset for Narrative Understanding
di: Baruah, Sabyasachee, et al.
Pubblicazione: (2024)
di: Baruah, Sabyasachee, et al.
Pubblicazione: (2024)
Visual Analytics for Fine-grained Text Classification Models and Datasets
di: Battogtokh, Munkhtulga, et al.
Pubblicazione: (2024)
di: Battogtokh, Munkhtulga, et al.
Pubblicazione: (2024)
HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
WebFAQ: A Multilingual Collection of Natural Q&A Datasets for Dense Retrieval
di: Dinzinger, Michael, et al.
Pubblicazione: (2025)
di: Dinzinger, Michael, et al.
Pubblicazione: (2025)
Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy
di: Senaratna, Nuwan I.
Pubblicazione: (2025)
di: Senaratna, Nuwan I.
Pubblicazione: (2025)
When Scale Meets Diversity: Evaluating Language Models on Fine-Grained Multilingual Claim Verification
di: Shcharbakova, Hanna, et al.
Pubblicazione: (2025)
di: Shcharbakova, Hanna, et al.
Pubblicazione: (2025)
MULTITAT: Benchmarking Multilingual Table-and-Text Question Answering
di: Zhang, Xuanliang, et al.
Pubblicazione: (2025)
di: Zhang, Xuanliang, et al.
Pubblicazione: (2025)
Renard: A Modular Pipeline for Extracting Character Networks from Narrative Texts
di: Amalvy, Arthur, et al.
Pubblicazione: (2024)
di: Amalvy, Arthur, et al.
Pubblicazione: (2024)
AVerImaTeC: A Dataset for Automatic Verification of Image-Text Claims with Evidence from the Web
di: Cao, Rui, et al.
Pubblicazione: (2025)
di: Cao, Rui, et al.
Pubblicazione: (2025)
OleSpeech-IV: A Large-Scale Multispeaker and Multilingual Conversational Speech Dataset with Diverse Topics
di: Chu, Wei, et al.
Pubblicazione: (2025)
di: Chu, Wei, et al.
Pubblicazione: (2025)
MARCA: A Checklist-Based Benchmark for Multilingual Web Search
di: Almeida, Thales Sales, et al.
Pubblicazione: (2026)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2026)
Advocating Character Error Rate for Multilingual ASR Evaluation
di: K, Thennal D, et al.
Pubblicazione: (2024)
di: K, Thennal D, et al.
Pubblicazione: (2024)
DynamicNER: A Dynamic, Multilingual, and Fine-Grained Dataset for LLM-based Named Entity Recognition
di: Luo, Hanjun, et al.
Pubblicazione: (2024)
di: Luo, Hanjun, et al.
Pubblicazione: (2024)
X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
di: Wang, Peng, et al.
Pubblicazione: (2025)
di: Wang, Peng, et al.
Pubblicazione: (2025)
Datasets for Multilingual Answer Sentence Selection
di: Gabburo, Matteo, et al.
Pubblicazione: (2024)
di: Gabburo, Matteo, et al.
Pubblicazione: (2024)
ViGoEmotions: A Benchmark Dataset For Fine-grained Emotion Detection on Vietnamese Texts
di: Tran, Hung Quang, et al.
Pubblicazione: (2026)
di: Tran, Hung Quang, et al.
Pubblicazione: (2026)
Multilingual Attribute Extraction from News Web Pages
di: Bedrin, Pavel, et al.
Pubblicazione: (2025)
di: Bedrin, Pavel, et al.
Pubblicazione: (2025)
Multilingual Reasoning Gym: Multilingual Scaling of Procedural Reasoning Environments
di: Dobler, Konstantin, et al.
Pubblicazione: (2026)
di: Dobler, Konstantin, et al.
Pubblicazione: (2026)
Fine-tuning Large Language Models for Multigenerator, Multidomain, and Multilingual Machine-Generated Text Detection
di: Xiong, Feng, et al.
Pubblicazione: (2024)
di: Xiong, Feng, et al.
Pubblicazione: (2024)
Oldies but Goldies: The Potential of Character N-grams for Romanian Texts
di: Lupsa, Dana, et al.
Pubblicazione: (2025)
di: Lupsa, Dana, et al.
Pubblicazione: (2025)
GeniL: A Multilingual Dataset on Generalizing Language
di: Davani, Aida Mostafazadeh, et al.
Pubblicazione: (2024)
di: Davani, Aida Mostafazadeh, et al.
Pubblicazione: (2024)
MULTITuDE: Large-Scale Multilingual Machine-Generated Text Detection Benchmark
di: Macko, Dominik, et al.
Pubblicazione: (2023)
di: Macko, Dominik, et al.
Pubblicazione: (2023)
SentiXRL: An advanced large language Model Framework for Multilingual Fine-Grained Emotion Classification in Complex Text Environment
di: Wang, Jie, et al.
Pubblicazione: (2024)
di: Wang, Jie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale
di: Penedo, Guilherme, et al.
Pubblicazione: (2024) -
Text2Freq: Learning Series Patterns from Text via Frequency Domain
di: Lo, Ming-Chih, et al.
Pubblicazione: (2024) -
FreqMark: Frequency-Based Watermark for Sentence-Level Detection of LLM-Generated Text
di: Xu, Zhenyu, et al.
Pubblicazione: (2024) -
FreqKV: Key-Value Compression in Frequency Domain for Context Window Extension
di: Kai, Jushi, et al.
Pubblicazione: (2025) -
UltraLink: An Open-Source Knowledge-Enhanced Multilingual Supervised Fine-tuning Dataset
di: Wang, Haoyu, et al.
Pubblicazione: (2024)