DecorateLM: Data Engineering through Corpus Rating, Tagging, and Editing with Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Ranchi, Thai, Zhen Leng, Zhang, Yifan, Hu, Shengding, Ba, Yunqi, Zhou, Jie, Cai, Jie, Liu, Zhiyuan, Sun, Maosong |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
States Hidden in Hidden States: LLMs Emerge Discrete State Representations Implicitly
by: Chen, Junhao, et al.
Published: (2024)
by: Chen, Junhao, et al.
Published: (2024)
Unified View of Grokking, Double Descent and Emergent Abilities: A Perspective from Circuits Competition
by: Huang, Yufei, et al.
Published: (2024)
by: Huang, Yufei, et al.
Published: (2024)
A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules
by: Luo, Kairong, et al.
Published: (2025)
by: Luo, Kairong, et al.
Published: (2025)
OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
by: He, Chaoqun, et al.
Published: (2024)
by: He, Chaoqun, et al.
Published: (2024)
StateX: Enhancing RNN Recall via Post-training State Expansion
by: Shen, Xingyu, et al.
Published: (2025)
by: Shen, Xingyu, et al.
Published: (2025)
$\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens
by: Zhang, Xinrong, et al.
Published: (2024)
by: Zhang, Xinrong, et al.
Published: (2024)
Stuffed Mamba: Oversized States Lead to the Inability to Forget
by: Chen, Yingfa, et al.
Published: (2024)
by: Chen, Yingfa, et al.
Published: (2024)
UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs
by: He, Chaoqun, et al.
Published: (2024)
by: He, Chaoqun, et al.
Published: (2024)
Cost-Optimal Grouped-Query Attention for Long-Context Modeling
by: Chen, Yingfa, et al.
Published: (2025)
by: Chen, Yingfa, et al.
Published: (2025)
KG-Infused RAG: Augmenting Corpus-Based RAG with External Knowledge Graphs
by: Wu, Dingjun, et al.
Published: (2025)
by: Wu, Dingjun, et al.
Published: (2025)
Representation Learning for Natural Language Processing
by: Liu, Zhiyuan, et al.
Published: (2020)
by: Liu, Zhiyuan, et al.
Published: (2020)
ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer
by: Hu, Jinyi, et al.
Published: (2024)
by: Hu, Jinyi, et al.
Published: (2024)
LEGENT: Open Platform for Embodied Agents
by: Cheng, Zhili, et al.
Published: (2024)
by: Cheng, Zhili, et al.
Published: (2024)
Beyond the Turn-Based Game: Enabling Real-Time Conversations with Duplex Models
by: Zhang, Xinrong, et al.
Published: (2024)
by: Zhang, Xinrong, et al.
Published: (2024)
MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies
by: Hu, Shengding, et al.
Published: (2024)
by: Hu, Shengding, et al.
Published: (2024)
ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models
by: Song, Chenyang, et al.
Published: (2024)
by: Song, Chenyang, et al.
Published: (2024)
Robust and Scalable Model Editing for Large Language Models
by: Chen, Yingfa, et al.
Published: (2024)
by: Chen, Yingfa, et al.
Published: (2024)
CorpusLM: Towards a Unified Language Model on Corpus for Knowledge-Intensive Tasks
by: Li, Xiaoxi, et al.
Published: (2024)
by: Li, Xiaoxi, et al.
Published: (2024)
Matrix Fejér-Riesz type theorem for a union of an interval and a point
by: Sun, Shengding, et al.
Published: (2025)
by: Sun, Shengding, et al.
Published: (2025)
VULCAN: Vision-Language-Model Enhanced Multi-Agent Cooperative Navigation for Indoor Fire-Disaster Response
by: Liu, Shengding, et al.
Published: (2026)
by: Liu, Shengding, et al.
Published: (2026)
On the strength of Burer's lifted convex relaxation to quadratic programming with ball constraints
by: Kılınç-Karzan, Fatma, et al.
Published: (2024)
by: Kılınç-Karzan, Fatma, et al.
Published: (2024)
Unraveling Interwoven Roles of Large Language Models in Authorship Privacy: Obfuscation, Mimicking, and Verification
by: Nguyen, Tuc, et al.
Published: (2025)
by: Nguyen, Tuc, et al.
Published: (2025)
Densing Law of LLMs
by: Xiao, Chaojun, et al.
Published: (2024)
by: Xiao, Chaojun, et al.
Published: (2024)
Predicting Emergent Abilities with Infinite Resolution Evaluation
by: Hu, Shengding, et al.
Published: (2023)
by: Hu, Shengding, et al.
Published: (2023)
AntLM: Bridging Causal and Masked Language Models
by: Yu, Xinru, et al.
Published: (2024)
by: Yu, Xinru, et al.
Published: (2024)
ZeroLM: Data-Free Transformer Architecture Search for Language Models
by: Chen, Zhen-Song, et al.
Published: (2025)
by: Chen, Zhen-Song, et al.
Published: (2025)
MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages
by: Lombard, Anri, et al.
Published: (2026)
by: Lombard, Anri, et al.
Published: (2026)
Identifying the Risks of LM Agents with an LM-Emulated Sandbox
by: Ruan, Yangjun, et al.
Published: (2023)
by: Ruan, Yangjun, et al.
Published: (2023)
Multi-stage Large Language Model Correction for Speech Recognition
by: Pu, Jie, et al.
Published: (2023)
by: Pu, Jie, et al.
Published: (2023)
Personal Relative Deprivation Leads to the Objectification of Social Targets: Exchange Orientation as a Mechanism
by: Xuegang Zheng, et al.
Published: (2025)
by: Xuegang Zheng, et al.
Published: (2025)
Tractable Approximation of Labeled Multi-Object Posterior Densities
by: Nguyen, Thi Hong Thai, et al.
Published: (2025)
by: Nguyen, Thi Hong Thai, et al.
Published: (2025)
Exact algorithms for quadratic optimization over roots of unity
by: Al-Sulami, Ahmad, et al.
Published: (2025)
by: Al-Sulami, Ahmad, et al.
Published: (2025)
Reverse-Engineering Model Editing on Language Models
by: Sun, Zhiyu, et al.
Published: (2026)
by: Sun, Zhiyu, et al.
Published: (2026)
EAG: Extract and Generate Multi-way Aligned Corpus for Complete Multi-lingual Neural Machine Translation
by: Xu, Yulin, et al.
Published: (2022)
by: Xu, Yulin, et al.
Published: (2022)
Rapid Fabrication of Polyvinyl Alcohol Hydrogel Foams With Encapsulated Mesenchymal Stem Cells for Chronic Wound Treatment
by: Nghia Le Ba Thai, et al.
Published: (2025)
by: Nghia Le Ba Thai, et al.
Published: (2025)
Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts
by: Wang, Xing, et al.
Published: (2025)
by: Wang, Xing, et al.
Published: (2025)
LLM$\times$MapReduce-V3: Enabling Interactive In-Depth Survey Generation through a MCP-Driven Hierarchically Modular Agent System
by: Chao, Yu, et al.
Published: (2025)
by: Chao, Yu, et al.
Published: (2025)
Beyond Individual Facts: Investigating Categorical Knowledge Locality of Taxonomy and Meronomy Concepts in GPT Models
by: Burger, Christopher, et al.
Published: (2024)
by: Burger, Christopher, et al.
Published: (2024)
Web-based Bengali News Corpus for Lexicon Development and POS Tagging
by: Asif Ekbal
Published: (2008)
by: Asif Ekbal
Published: (2008)
MiniCPM-V: A GPT-4V Level MLLM on Your Phone
by: Yao, Yuan, et al.
Published: (2024)
by: Yao, Yuan, et al.
Published: (2024)
Similar Items
-
States Hidden in Hidden States: LLMs Emerge Discrete State Representations Implicitly
by: Chen, Junhao, et al.
Published: (2024) -
Unified View of Grokking, Double Descent and Emergent Abilities: A Perspective from Circuits Competition
by: Huang, Yufei, et al.
Published: (2024) -
A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules
by: Luo, Kairong, et al.
Published: (2025) -
OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
by: He, Chaoqun, et al.
Published: (2024) -
StateX: Enhancing RNN Recall via Post-training State Expansion
by: Shen, Xingyu, et al.
Published: (2025)