NYT-Connections: A Deceptively Simple Text Classification Task that Stumps System-1 Thinkers
Fuente:
arXiv
Saved in:
| Main Authors: | Lopez, Angel Yahir Loredo, McDonald, Tyler, Emami, Ali |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Trace-of-Thought Prompting: Investigating Prompt-Based Knowledge Distillation Through Question Decomposition
by: McDonald, Tyler, et al.
Published: (2025)
by: McDonald, Tyler, et al.
Published: (2025)
STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions
by: Morabito, Robert, et al.
Published: (2024)
by: Morabito, Robert, et al.
Published: (2024)
The Dog the Cat Chased Stumped the Model: Measuring When Language Models Abandon Structure for Shortcuts
by: Madhusudan, Sangmitra, et al.
Published: (2025)
by: Madhusudan, Sangmitra, et al.
Published: (2025)
Can We Afford The Perfect Prompt? Balancing Cost and Accuracy with the Economical Prompting Index
by: McDonald, Tyler, et al.
Published: (2024)
by: McDonald, Tyler, et al.
Published: (2024)
A Simple Ensemble Strategy for LLM Inference: Towards More Stable Text Classification
by: Niimi, Junichiro
Published: (2025)
by: Niimi, Junichiro
Published: (2025)
MirrorStories: Reflecting Diversity through Personalized Narrative Generation with Large Language Models
by: Yunusov, Sarfaroz, et al.
Published: (2024)
by: Yunusov, Sarfaroz, et al.
Published: (2024)
Exploring Variability in Fine-Tuned Models for Text Classification with DistilBERT
by: Lorenzoni, Giuliano, et al.
Published: (2024)
by: Lorenzoni, Giuliano, et al.
Published: (2024)
Flick: Few Labels Text Classification using K-Aware Intermediate Learning in Multi-Task Low-Resource Languages
by: Almutairi, Ali, et al.
Published: (2025)
by: Almutairi, Ali, et al.
Published: (2025)
Multi-Step Dialogue Workflow Action Prediction
by: Ramakrishnan, Ramya, et al.
Published: (2023)
by: Ramakrishnan, Ramya, et al.
Published: (2023)
Benchmarking Open-Source Large Language Models on Healthcare Text Classification Tasks
by: Guo, Yuting, et al.
Published: (2025)
by: Guo, Yuting, et al.
Published: (2025)
Multi-Task Pre-Finetuning of Lightweight Transformer Encoders for Text Classification and NER
by: Zhu, Junyi, et al.
Published: (2025)
by: Zhu, Junyi, et al.
Published: (2025)
Simple Hack for Transformers against Heavy Long-Text Classification on a Time- and Memory-Limited GPU Service
by: Mutasodirin, Mirza Alim, et al.
Published: (2024)
by: Mutasodirin, Mirza Alim, et al.
Published: (2024)
Arctic-Text2SQL-R1: Simple Rewards, Strong Reasoning in Text-to-SQL
by: Yao, Zhewei, et al.
Published: (2025)
by: Yao, Zhewei, et al.
Published: (2025)
Multilingual LLMs Are Not Multilingual Thinkers: Evidence from Hindi Analogy Evaluation
by: Gupta, Ashray, et al.
Published: (2025)
by: Gupta, Ashray, et al.
Published: (2025)
Difficult Task Yes but Simple Task No: Unveiling the Laziness in Multimodal LLMs
by: Zhao, Sihang, et al.
Published: (2024)
by: Zhao, Sihang, et al.
Published: (2024)
Pooling Attention: Evaluating Pretrained Transformer Embeddings for Deception Classification
by: Mamtani, Sumit, et al.
Published: (2025)
by: Mamtani, Sumit, et al.
Published: (2025)
Deceptive Automated Interpretability: Language Models Coordinating to Fool Oversight Systems
by: Lermen, Simon, et al.
Published: (2025)
by: Lermen, Simon, et al.
Published: (2025)
Evaluating Large Language Models for Health-Related Text Classification Tasks with Public Social Media Data
by: Guo, Yuting, et al.
Published: (2024)
by: Guo, Yuting, et al.
Published: (2024)
Parameterized Synthetic Text Generation with SimpleStories
by: Finke, Lennart, et al.
Published: (2025)
by: Finke, Lennart, et al.
Published: (2025)
SmartThinker: Learning to Compress and Preserve Reasoning by Step-Level Length Control
by: He, Xingyang, et al.
Published: (2025)
by: He, Xingyang, et al.
Published: (2025)
An Assessment of Model-On-Model Deception
by: Heitkoetter, Julius, et al.
Published: (2024)
by: Heitkoetter, Julius, et al.
Published: (2024)
OpenDeception: Learning Deception and Trust in Human-AI Interaction via Multi-Agent Simulation
by: Wu, Yichen, et al.
Published: (2025)
by: Wu, Yichen, et al.
Published: (2025)
Whitening Not Recommended for Classification Tasks in LLMs
by: Forooghi, Ali, et al.
Published: (2024)
by: Forooghi, Ali, et al.
Published: (2024)
Multi-Label Clinical Text Eligibility Classification and Summarization System
by: Yerramsetty, Surya Tejaswi, et al.
Published: (2025)
by: Yerramsetty, Surya Tejaswi, et al.
Published: (2025)
Subtle Biases Need Subtler Measures: Dual Metrics for Evaluating Representative and Affinity Bias in Large Language Models
by: Kumar, Abhishek, et al.
Published: (2024)
by: Kumar, Abhishek, et al.
Published: (2024)
A NotSo Simple Way to Beat Simple Bench
by: Sane, Soham, et al.
Published: (2024)
by: Sane, Soham, et al.
Published: (2024)
Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn Interaction
by: Xu, Jun, et al.
Published: (2025)
by: Xu, Jun, et al.
Published: (2025)
KAG-Thinker: Interactive Thinking and Deep Reasoning in LLMs via Knowledge-Augmented Generation
by: Zhang, Dalong, et al.
Published: (2025)
by: Zhang, Dalong, et al.
Published: (2025)
TALE: A Tool-Augmented Framework for Reference-Free Evaluation of Large Language Models
by: Badshah, Sher, et al.
Published: (2025)
by: Badshah, Sher, et al.
Published: (2025)
Where Does Reasoning Break? Step-Level Hallucination Detection via Hidden-State Transport Geometry
by: Alvarez, Tyler, et al.
Published: (2026)
by: Alvarez, Tyler, et al.
Published: (2026)
Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers
by: Green, Tommaso, et al.
Published: (2025)
by: Green, Tommaso, et al.
Published: (2025)
The Markovian Thinker: Architecture-Agnostic Linear Scaling of Reasoning
by: Aghajohari, Milad, et al.
Published: (2025)
by: Aghajohari, Milad, et al.
Published: (2025)
Adverb Is the Key: Simple Text Data Augmentation with Adverb Deletion
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
To Tell The Truth: Language of Deception and Language Models
by: Hazra, Sanchaita, et al.
Published: (2023)
by: Hazra, Sanchaita, et al.
Published: (2023)
ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute
by: Wen, Hao, et al.
Published: (2025)
by: Wen, Hao, et al.
Published: (2025)
OTCE: Hybrid SSM and Attention with Cross Domain Mixture of Experts to construct Observer-Thinker-Conceiver-Expresser
by: Shi, Jingze, et al.
Published: (2024)
by: Shi, Jingze, et al.
Published: (2024)
Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B
by: Xu, Sen, et al.
Published: (2025)
by: Xu, Sen, et al.
Published: (2025)
OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
by: Wang, Zengzhi, et al.
Published: (2025)
by: Wang, Zengzhi, et al.
Published: (2025)
uTeBC-NLP at SemEval-2024 Task 9: Can LLMs be Lateral Thinkers?
by: Sadeghi, Pouya, et al.
Published: (2024)
by: Sadeghi, Pouya, et al.
Published: (2024)
Political Leaning and Politicalness Classification of Texts
by: Volf, Matous, et al.
Published: (2025)
by: Volf, Matous, et al.
Published: (2025)
Similar Items
-
Trace-of-Thought Prompting: Investigating Prompt-Based Knowledge Distillation Through Question Decomposition
by: McDonald, Tyler, et al.
Published: (2025) -
STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions
by: Morabito, Robert, et al.
Published: (2024) -
The Dog the Cat Chased Stumped the Model: Measuring When Language Models Abandon Structure for Shortcuts
by: Madhusudan, Sangmitra, et al.
Published: (2025) -
Can We Afford The Perfect Prompt? Balancing Cost and Accuracy with the Economical Prompting Index
by: McDonald, Tyler, et al.
Published: (2024) -
A Simple Ensemble Strategy for LLM Inference: Towards More Stable Text Classification
by: Niimi, Junichiro
Published: (2025)