Text-Preserving Lossy Text Compression: A Study of Strategic Deletion and LLM Reconstruction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zou, Yuchun, Tong, Junhong, Li, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Lossy Horizon: Error-Bounded Predictive Coding for Lossy Text Compression (Episode I)
par: Aghanya, Nnamdi, et autres
Publié: (2025)
par: Aghanya, Nnamdi, et autres
Publié: (2025)
SemanticZip: A Pilot Framework for Lossy Text Compression with LLMs as Semantic Decompressors
par: Trukhina, Natalia, et autres
Publié: (2026)
par: Trukhina, Natalia, et autres
Publié: (2026)
Learning is Forgetting: LLM Training As Lossy Compression
par: Conklin, Henry C., et autres
Publié: (2026)
par: Conklin, Henry C., et autres
Publié: (2026)
Wikipedia is Not a Dictionary, Delete! Text Classification as a Proxy for Analysing Wiki Deletion Discussions
par: Borkakoty, Hsuvas, et autres
Publié: (2025)
par: Borkakoty, Hsuvas, et autres
Publié: (2025)
Adverb Is the Key: Simple Text Data Augmentation with Adverb Deletion
par: Choi, Juhwan, et autres
Publié: (2024)
par: Choi, Juhwan, et autres
Publié: (2024)
Text Compression for Efficient Language Generation
par: Gu, David, et autres
Publié: (2025)
par: Gu, David, et autres
Publié: (2025)
Anonymous-by-Construction: An LLM-Driven Framework for Privacy-Preserving Text
par: Albanese, Federico, et autres
Publié: (2026)
par: Albanese, Federico, et autres
Publié: (2026)
Look Ahead Text Understanding and LLM Stitching
par: Jiang, Junlin Julian, et autres
Publié: (2024)
par: Jiang, Junlin Julian, et autres
Publié: (2024)
Multi-LLM Text Summarization
par: Fang, Jiangnan, et autres
Publié: (2024)
par: Fang, Jiangnan, et autres
Publié: (2024)
VTC-R1: Vision-Text Compression for Efficient Long-Context Reasoning
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
Context Cascade Compression: Exploring the Upper Limits of Text Compression
par: Liu, Fanfan, et autres
Publié: (2025)
par: Liu, Fanfan, et autres
Publié: (2025)
Hypernym Mercury: Token Optimization Through Semantic Field Constriction And Reconstruction From Hypernyms. A New Text Compression Method
par: Forrester, Chris, et autres
Publié: (2025)
par: Forrester, Chris, et autres
Publié: (2025)
Beyond Text Compression: Evaluating Tokenizers Across Scales
par: Lotz, Jonas F., et autres
Publié: (2025)
par: Lotz, Jonas F., et autres
Publié: (2025)
Pushing The Limit of LLM Capacity for Text Classification
par: Zhang, Yazhou, et autres
Publié: (2024)
par: Zhang, Yazhou, et autres
Publié: (2024)
Rethinking the Privacy of Text Embeddings: A Reproducibility Study of "Text Embeddings Reveal (Almost) As Much As Text"
par: Seputis, Dominykas, et autres
Publié: (2025)
par: Seputis, Dominykas, et autres
Publié: (2025)
RB-SQL: A Retrieval-based LLM Framework for Text-to-SQL
par: Wu, Zhenhe, et autres
Publié: (2024)
par: Wu, Zhenhe, et autres
Publié: (2024)
Beyond Easy Wins: A Text Hardness-Aware Benchmark for LLM-generated Text Detection
par: Ayoobi, Navid, et autres
Publié: (2025)
par: Ayoobi, Navid, et autres
Publié: (2025)
Advancing NLP Models with Strategic Text Augmentation: A Comprehensive Study of Augmentation Methods and Curriculum Strategies
par: Kesgin, Himmet Toprak, et autres
Publié: (2024)
par: Kesgin, Himmet Toprak, et autres
Publié: (2024)
Fact-Preserved Personalized News Headline Generation
par: Yang, Zhao, et autres
Publié: (2025)
par: Yang, Zhao, et autres
Publié: (2025)
The Lottery LLM Hypothesis, Rethinking What Abilities Should LLM Compression Preserve?
par: Tang, Zhenheng, et autres
Publié: (2025)
par: Tang, Zhenheng, et autres
Publié: (2025)
Training LLMs over Neurally Compressed Text
par: Lester, Brian, et autres
Publié: (2024)
par: Lester, Brian, et autres
Publié: (2024)
Assessing Human Editing Effort on LLM-Generated Texts via Compression-Based Edit Distance
par: Devatine, Nicolas, et autres
Publié: (2024)
par: Devatine, Nicolas, et autres
Publié: (2024)
On the Detectability of LLM-Generated Text: What Exactly Is LLM-Generated Text?
par: Geng, Mingmeng, et autres
Publié: (2025)
par: Geng, Mingmeng, et autres
Publié: (2025)
Learning to Rewrite: Generalized LLM-Generated Text Detection
par: Li, Ran, et autres
Publié: (2024)
par: Li, Ran, et autres
Publié: (2024)
Cosmos: Compressed and Smooth Latent Space for Text Diffusion Modeling
par: Meshchaninov, Viacheslav, et autres
Publié: (2025)
par: Meshchaninov, Viacheslav, et autres
Publié: (2025)
StyleDecipher: Robust and Explainable Detection of LLM-Generated Texts with Stylistic Analysis
par: Li, Siyuan, et autres
Publié: (2025)
par: Li, Siyuan, et autres
Publié: (2025)
QUDsim: Quantifying Discourse Similarities in LLM-Generated Text
par: Namuduri, Ramya, et autres
Publié: (2025)
par: Namuduri, Ramya, et autres
Publié: (2025)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
TextQuests: How Good are LLMs at Text-Based Video Games?
par: Phan, Long, et autres
Publié: (2025)
par: Phan, Long, et autres
Publié: (2025)
NAP^2: A Benchmark for Naturalness and Privacy-Preserving Text Rewriting by Learning from Human
par: Huang, Shuo, et autres
Publié: (2024)
par: Huang, Shuo, et autres
Publié: (2024)
Robust Utility-Preserving Text Anonymization Based on Large Language Models
par: Yang, Tianyu, et autres
Publié: (2024)
par: Yang, Tianyu, et autres
Publié: (2024)
Current State in Privacy-Preserving Text Preprocessing for Domain-Agnostic NLP
par: Sinha, Abhirup, et autres
Publié: (2025)
par: Sinha, Abhirup, et autres
Publié: (2025)
The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval
par: Tong, Zekai, et autres
Publié: (2026)
par: Tong, Zekai, et autres
Publié: (2026)
Hierarchical Text Classification with LLM-Refined Taxonomies
par: Golde, Jonas, et autres
Publié: (2026)
par: Golde, Jonas, et autres
Publié: (2026)
Enhancing Medication Recommendation with LLM Text Representation
par: Lee, Yu-Tzu
Publié: (2024)
par: Lee, Yu-Tzu
Publié: (2024)
Model-Agnostic Sentiment Distribution Stability Analysis for Robust LLM-Generated Texts Detection
par: Li, Siyuan, et autres
Publié: (2025)
par: Li, Siyuan, et autres
Publié: (2025)
On Preserving the Knowledge of Long Clinical Texts
par: Hasan, Mohammad Junayed, et autres
Publié: (2023)
par: Hasan, Mohammad Junayed, et autres
Publié: (2023)
Token Prediction as Implicit Classification to Identify LLM-Generated Text
par: Chen, Yutian, et autres
Publié: (2023)
par: Chen, Yutian, et autres
Publié: (2023)
Cited Text Spans for Citation Text Generation
par: Li, Xiangci, et autres
Publié: (2023)
par: Li, Xiangci, et autres
Publié: (2023)
DSIPA: Detecting LLM-Generated Texts via Sentiment-Invariant Patterns Divergence Analysis
par: Li, Siyuan, et autres
Publié: (2026)
par: Li, Siyuan, et autres
Publié: (2026)
Documents similaires
-
The Lossy Horizon: Error-Bounded Predictive Coding for Lossy Text Compression (Episode I)
par: Aghanya, Nnamdi, et autres
Publié: (2025) -
SemanticZip: A Pilot Framework for Lossy Text Compression with LLMs as Semantic Decompressors
par: Trukhina, Natalia, et autres
Publié: (2026) -
Learning is Forgetting: LLM Training As Lossy Compression
par: Conklin, Henry C., et autres
Publié: (2026) -
Wikipedia is Not a Dictionary, Delete! Text Classification as a Proxy for Analysing Wiki Deletion Discussions
par: Borkakoty, Hsuvas, et autres
Publié: (2025) -
Adverb Is the Key: Simple Text Data Augmentation with Adverb Deletion
par: Choi, Juhwan, et autres
Publié: (2024)