STRICT: Stress Test of Rendering Images Containing Text
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Tianyu, Wang, Xinyu, Li, Lu, Tai, Zhenghan, Chi, Jijun, Tian, Jingrui, He, Hailin, Wang, Suyuchen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs
par: Balter, Samuel G., et autres
Publié: (2026)
par: Balter, Samuel G., et autres
Publié: (2026)
Chatbots put to the test in math and logic problems: A preliminary comparison and assessment of ChatGPT-3.5, ChatGPT-4, and Google Bard
par: Plevris, Vagelis, et autres
Publié: (2023)
par: Plevris, Vagelis, et autres
Publié: (2023)
Prompt Tuned Embedding Classification for Multi-Label Industry Sector Allocation
par: Buchner, Valentin Leonhard, et autres
Publié: (2023)
par: Buchner, Valentin Leonhard, et autres
Publié: (2023)
LegalGuardian: A Privacy-Preserving Framework for Secure Integration of Large Language Models in Legal Practice
par: Demir, M. Mikail, et autres
Publié: (2025)
par: Demir, M. Mikail, et autres
Publié: (2025)
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
par: Tu, Songjun, et autres
Publié: (2026)
par: Tu, Songjun, et autres
Publié: (2026)
Large Language Models Report Subjective Experience Under Self-Referential Processing
par: Berg, Cameron, et autres
Publié: (2025)
par: Berg, Cameron, et autres
Publié: (2025)
Profiling German Text Simplification with Interpretable Model-Fingerprints
par: Klöser, Lars, et autres
Publié: (2026)
par: Klöser, Lars, et autres
Publié: (2026)
Co-NAML-LSTUR: A Combined Model with Attentive Multi-View Learning and Long- and Short-term User Representations for News Recommendation
par: Nguyen, Minh Hoang, et autres
Publié: (2025)
par: Nguyen, Minh Hoang, et autres
Publié: (2025)
A Survey of Text Watermarking in the Era of Large Language Models
par: Liu, Aiwei, et autres
Publié: (2023)
par: Liu, Aiwei, et autres
Publié: (2023)
Contrasting Linguistic Patterns in Human and LLM-Generated News Text
par: Muñoz-Ortiz, Alberto, et autres
Publié: (2023)
par: Muñoz-Ortiz, Alberto, et autres
Publié: (2023)
BEATS: Bias Evaluation and Assessment Test Suite for Large Language Models
par: Abhishek, Alok, et autres
Publié: (2025)
par: Abhishek, Alok, et autres
Publié: (2025)
Prior-based Noisy Text Data Filtering: Fast and Strong Alternative For Perplexity
par: Seo, Yeongbin, et autres
Publié: (2025)
par: Seo, Yeongbin, et autres
Publié: (2025)
Testing the assumptions about the geometry of sentence embedding spaces: the cosine measure need not apply
par: Nastase, Vivi, et autres
Publié: (2025)
par: Nastase, Vivi, et autres
Publié: (2025)
New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR
par: Wang, Zhilin, et autres
Publié: (2026)
par: Wang, Zhilin, et autres
Publié: (2026)
Parametric Social Identity Injection and Diversification in Public Opinion Simulation
par: Wang, Hexi, et autres
Publié: (2026)
par: Wang, Hexi, et autres
Publié: (2026)
The Superalignment of Superhuman Intelligence with Large Language Models
par: Huang, Minlie, et autres
Publié: (2024)
par: Huang, Minlie, et autres
Publié: (2024)
When Retrieval Succeeds and Fails: Rethinking Retrieval-Augmented Generation for LLMs
par: Wang, Yongjie, et autres
Publié: (2025)
par: Wang, Yongjie, et autres
Publié: (2025)
Unveiling Attractor Cycles in Large Language Models: A Dynamical Systems View of Successive Paraphrasing
par: Wang, Zhilin, et autres
Publié: (2025)
par: Wang, Zhilin, et autres
Publié: (2025)
NOTAI.AI: Explainable Detection of Machine-Generated Text via Curvature and Feature Attribution
par: Breneur, Oleksandr Marchenko, et autres
Publié: (2026)
par: Breneur, Oleksandr Marchenko, et autres
Publié: (2026)
A Survey on Natural Language Counterfactual Generation
par: Wang, Yongjie, et autres
Publié: (2024)
par: Wang, Yongjie, et autres
Publié: (2024)
Direct Large Language Model Alignment Through Self-Rewarding Contrastive Prompt Distillation
par: Liu, Aiwei, et autres
Publié: (2024)
par: Liu, Aiwei, et autres
Publié: (2024)
Enhancing OCR for Sino-Vietnamese Language Processing via Fine-tuned PaddleOCRv5
par: Nguyen, Minh Hoang, et autres
Publié: (2025)
par: Nguyen, Minh Hoang, et autres
Publié: (2025)
TIS-DPO: Token-level Importance Sampling for Direct Preference Optimization With Estimated Weights
par: Liu, Aiwei, et autres
Publié: (2024)
par: Liu, Aiwei, et autres
Publié: (2024)
Reference-Guided Verdict: LLMs-as-Judges in Automatic Evaluation of Free-Form QA
par: Badshah, Sher, et autres
Publié: (2024)
par: Badshah, Sher, et autres
Publié: (2024)
Towards Effective and Efficient Continual Pre-training of Large Language Models
par: Chen, Jie, et autres
Publié: (2024)
par: Chen, Jie, et autres
Publié: (2024)
A Comparative Analysis of Noise Reduction Methods in Sentiment Analysis on Noisy Bangla Texts
par: Elahi, Kazi Toufique, et autres
Publié: (2024)
par: Elahi, Kazi Toufique, et autres
Publié: (2024)
FarsEval-PKBETS: A new diverse benchmark for evaluating Persian large language models
par: Shamsfard, Mehrnoush, et autres
Publié: (2025)
par: Shamsfard, Mehrnoush, et autres
Publié: (2025)
Diverse LLMs or Diverse Question Interpretations? That is the Ensembling Question
par: Rosales, Rafael, et autres
Publié: (2025)
par: Rosales, Rafael, et autres
Publié: (2025)
Data and AI governance: Promoting equity, ethics, and fairness in large language models
par: Abhishek, Alok, et autres
Publié: (2025)
par: Abhishek, Alok, et autres
Publié: (2025)
SHARP: Social Harm Analysis via Risk Profiles for Measuring Inequities in Large Language Models
par: Abhishek, Alok, et autres
Publié: (2026)
par: Abhishek, Alok, et autres
Publié: (2026)
Reasoning Promotes Robustness in Theory of Mind Tasks
par: de Haan, Ian B., et autres
Publié: (2026)
par: de Haan, Ian B., et autres
Publié: (2026)
Grandes modelos de lenguaje: de la predicción de palabras a la comprensión?
par: Gómez-Rodríguez, Carlos
Publié: (2025)
par: Gómez-Rodríguez, Carlos
Publié: (2025)
The Knesset Corpus: An Annotated Corpus of Hebrew Parliamentary Proceedings
par: Goldin, Gili, et autres
Publié: (2024)
par: Goldin, Gili, et autres
Publié: (2024)
Math Natural Language Inference: this should be easy!
par: de Paiva, Valeria, et autres
Publié: (2025)
par: de Paiva, Valeria, et autres
Publié: (2025)
Fast Quiet-STaR: Thinking Without Thought Tokens
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models
par: Pan, Leyi, et autres
Publié: (2025)
par: Pan, Leyi, et autres
Publié: (2025)
An Unforgeable Publicly Verifiable Watermark for Large Language Models
par: Liu, Aiwei, et autres
Publié: (2023)
par: Liu, Aiwei, et autres
Publié: (2023)
The Unlikely Duel: Evaluating Creative Writing in LLMs through a Unique Scenario
par: Gómez-Rodríguez, Carlos, et autres
Publié: (2024)
par: Gómez-Rodríguez, Carlos, et autres
Publié: (2024)
SentiCSE: A Sentiment-aware Contrastive Sentence Embedding Framework with Sentiment-guided Textual Similarity
par: Kim, Jaemin, et autres
Publié: (2024)
par: Kim, Jaemin, et autres
Publié: (2024)
Exploiting Pre-trained Encoder-Decoder Transformers for Sequence-to-Sequence Constituent Parsing
par: Fernández-González, Daniel, et autres
Publié: (2026)
par: Fernández-González, Daniel, et autres
Publié: (2026)
Documents similaires
-
Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs
par: Balter, Samuel G., et autres
Publié: (2026) -
Chatbots put to the test in math and logic problems: A preliminary comparison and assessment of ChatGPT-3.5, ChatGPT-4, and Google Bard
par: Plevris, Vagelis, et autres
Publié: (2023) -
Prompt Tuned Embedding Classification for Multi-Label Industry Sector Allocation
par: Buchner, Valentin Leonhard, et autres
Publié: (2023) -
LegalGuardian: A Privacy-Preserving Framework for Secure Integration of Large Language Models in Legal Practice
par: Demir, M. Mikail, et autres
Publié: (2025) -
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
par: Tu, Songjun, et autres
Publié: (2026)