Token Prediction as Implicit Classification to Identify LLM-Generated Text
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yutian, Kang, Hao, Zhai, Vivian, Li, Liangze, Singh, Rita, Raj, Bhiksha |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
On the Robust Approximation of ASR Metrics
par: Waheed, Abdul, et autres
Publié: (2025)
par: Waheed, Abdul, et autres
Publié: (2025)
What and When to Learn: CURriculum Ranking Loss for Large-Scale Speaker Verification
par: Baali, Massa, et autres
Publié: (2026)
par: Baali, Massa, et autres
Publié: (2026)
PhoniTale: Phonologically Grounded Mnemonic Generation for Typologically Distant Language Pairs
par: Kang, Sana, et autres
Publié: (2025)
par: Kang, Sana, et autres
Publié: (2025)
What Do Speech Foundation Models Not Learn About Speech?
par: Waheed, Abdul, et autres
Publié: (2024)
par: Waheed, Abdul, et autres
Publié: (2024)
Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Models
par: Atwany, Hanin, et autres
Publié: (2025)
par: Atwany, Hanin, et autres
Publié: (2025)
CAARMA: Class Augmentation with Adversarial Mixup Regularization
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
PDAF: A Phonetic Debiasing Attention Framework For Speaker Verification
par: Baali, Massa, et autres
Publié: (2024)
par: Baali, Massa, et autres
Publié: (2024)
NITP: Next Implicit Token Prediction for LLM Pre-training
par: Zhang, Xiangdong, et autres
Publié: (2026)
par: Zhang, Xiangdong, et autres
Publié: (2026)
SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
par: Waheed, Abdul, et autres
Publié: (2025)
par: Waheed, Abdul, et autres
Publié: (2025)
Speech vs. Transcript: Does It Matter for Human Annotators in Speech Summarization?
par: Sharma, Roshan, et autres
Publié: (2024)
par: Sharma, Roshan, et autres
Publié: (2024)
On Fairness of Unified Multimodal Large Language Model for Image Generation
par: Liu, Ming, et autres
Publié: (2025)
par: Liu, Ming, et autres
Publié: (2025)
Revisiting Acoustic Features for Robust ASR
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
Beyond the Next Token: Towards Prompt-Robust Zero-Shot Classification via Efficient Multi-Token Prediction
par: Qian, Junlang, et autres
Publié: (2025)
par: Qian, Junlang, et autres
Publié: (2025)
Tracing Thought: Using Chain-of-Thought Reasoning to Identify the LLM Behind AI-Generated Text
par: Agrahari, Shifali, et autres
Publié: (2025)
par: Agrahari, Shifali, et autres
Publié: (2025)
Explainability-Based Token Replacement on LLM-Generated Text
par: Mohammadi, Hadi, et autres
Publié: (2025)
par: Mohammadi, Hadi, et autres
Publié: (2025)
Zero-Shot Detection of LLM-Generated Text using Token Cohesiveness
par: Ma, Shixuan, et autres
Publié: (2024)
par: Ma, Shixuan, et autres
Publié: (2024)
On the Diversity of Synthetic Data and its Impact on Training Large Language Models
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
Text Generation Beyond Discrete Token Sampling
par: Zhuang, Yufan, et autres
Publié: (2025)
par: Zhuang, Yufan, et autres
Publié: (2025)
CoLMbo: Speaker Language Model for Descriptive Profiling
par: Baali, Massa, et autres
Publié: (2025)
par: Baali, Massa, et autres
Publié: (2025)
Learning to Rewrite: Generalized LLM-Generated Text Detection
par: Li, Ran, et autres
Publié: (2024)
par: Li, Ran, et autres
Publié: (2024)
Exons-Detect: Identifying and Amplifying Exonic Tokens via Hidden-State Discrepancy for Robust AI-Generated Text Detection
par: Zhu, Xiaowei, et autres
Publié: (2026)
par: Zhu, Xiaowei, et autres
Publié: (2026)
WhisperRT -- Turning Whisper into a Causal Streaming Model
par: Krichli, Tomer, et autres
Publié: (2025)
par: Krichli, Tomer, et autres
Publié: (2025)
Text-to-Distribution Prediction with Quantile Tokens and Neighbor Context
par: Zhu, Yilun, et autres
Publié: (2026)
par: Zhu, Yilun, et autres
Publié: (2026)
Breaking the Ceiling of the LLM Community by Treating Token Generation as a Classification for Ensembling
par: Yu, Yao-Ching, et autres
Publié: (2024)
par: Yu, Yao-Ching, et autres
Publié: (2024)
Alternatives To Next Token Prediction In Text Generation -- A Survey
par: Wyatt, Charlie, et autres
Publié: (2025)
par: Wyatt, Charlie, et autres
Publié: (2025)
Text2Token: Unsupervised Text Representation Learning with Token Target Prediction
par: An, Ruize, et autres
Publié: (2025)
par: An, Ruize, et autres
Publié: (2025)
Zero-Shot Detection of LLM-Generated Text via Implicit Reward Model
par: Liu, Runheng, et autres
Publié: (2026)
par: Liu, Runheng, et autres
Publié: (2026)
Implicit Optimization Bias of Next-Token Prediction in Linear Models
par: Thrampoulidis, Christos
Publié: (2024)
par: Thrampoulidis, Christos
Publié: (2024)
Frame Representation Hypothesis: Multi-Token LLM Interpretability and Concept-Guided Text Generation
par: Valois, Pedro H. V., et autres
Publié: (2024)
par: Valois, Pedro H. V., et autres
Publié: (2024)
An Experimental Evaluation of Japanese Tokenizers for Sentiment-Based Text Classification
par: Rusli, Andre, et autres
Publié: (2024)
par: Rusli, Andre, et autres
Publié: (2024)
Pushing The Limit of LLM Capacity for Text Classification
par: Zhang, Yazhou, et autres
Publié: (2024)
par: Zhang, Yazhou, et autres
Publié: (2024)
OleSpeech-IV: A Large-Scale Multispeaker and Multilingual Conversational Speech Dataset with Diverse Topics
par: Chu, Wei, et autres
Publié: (2025)
par: Chu, Wei, et autres
Publié: (2025)
AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
Human Voice is Unique
par: Singh, Rita, et autres
Publié: (2025)
par: Singh, Rita, et autres
Publié: (2025)
Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling
par: Cappelletti, Silvia, et autres
Publié: (2025)
par: Cappelletti, Silvia, et autres
Publié: (2025)
Improving Cross-Domain Low-Resource Text Generation through LLM Post-Editing: A Programmer-Interpreter Approach
par: Li, Zhuang, et autres
Publié: (2024)
par: Li, Zhuang, et autres
Publié: (2024)
Geometry of Semantics in Next-Token Prediction: How Optimization Implicitly Organizes Linguistic Representations
par: Zhao, Yize, et autres
Publié: (2025)
par: Zhao, Yize, et autres
Publié: (2025)
TurboRAG: Accelerating Retrieval-Augmented Generation with Precomputed KV Caches for Chunked Text
par: Lu, Songshuo, et autres
Publié: (2024)
par: Lu, Songshuo, et autres
Publié: (2024)
Documents similaires
-
DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model
par: Baali, Massa, et autres
Publié: (2025) -
On the Robust Approximation of ASR Metrics
par: Waheed, Abdul, et autres
Publié: (2025) -
What and When to Learn: CURriculum Ranking Loss for Large-Scale Speaker Verification
par: Baali, Massa, et autres
Publié: (2026) -
PhoniTale: Phonologically Grounded Mnemonic Generation for Typologically Distant Language Pairs
par: Kang, Sana, et autres
Publié: (2025) -
What Do Speech Foundation Models Not Learn About Speech?
par: Waheed, Abdul, et autres
Publié: (2024)