Geolocation with Real Human Gameplay Data: A Large-Scale Dataset and Human-Like Reasoning Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Zirui, Yang, Jingpu, Huang, Yuan, Tonglet, Jonathan, Zhang, Zeyu, Cheng, Tao, Fang, Meng, Gurevych, Iryna, Chen, Xiuying |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
M4FC: a Multimodal, Multilingual, Multicultural, Multitask Real-World Fact-Checking Dataset
par: Geng, Jiahui, et autres
Publié: (2025)
par: Geng, Jiahui, et autres
Publié: (2025)
COVE: COntext and VEracity prediction for out-of-context images
par: Tonglet, Jonathan, et autres
Publié: (2025)
par: Tonglet, Jonathan, et autres
Publié: (2025)
"Image, Tell me your story!" Predicting the original meta-context of visual misinformation
par: Tonglet, Jonathan, et autres
Publié: (2024)
par: Tonglet, Jonathan, et autres
Publié: (2024)
Is this chart lying to me? Automating the detection of misleading visualizations
par: Tonglet, Jonathan, et autres
Publié: (2025)
par: Tonglet, Jonathan, et autres
Publié: (2025)
NewsRECON: News article REtrieval for image CONtextualization
par: Tonglet, Jonathan, et autres
Publié: (2026)
par: Tonglet, Jonathan, et autres
Publié: (2026)
Protecting multimodal large language models against misleading visualizations
par: Tonglet, Jonathan, et autres
Publié: (2025)
par: Tonglet, Jonathan, et autres
Publié: (2025)
ChartAttack: Testing the Vulnerability of LLMs to Malicious Prompting in Chart Generation
par: Ortiz-Barajas, Jesus-German, et autres
Publié: (2026)
par: Ortiz-Barajas, Jesus-German, et autres
Publié: (2026)
Co-FactChecker: A Framework for Human-AI Collaborative Claim Verification Using Large Reasoning Models
par: Sahnan, Dhruv, et autres
Publié: (2026)
par: Sahnan, Dhruv, et autres
Publié: (2026)
Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework
par: Dycke, Nils, et autres
Publié: (2025)
par: Dycke, Nils, et autres
Publié: (2025)
Like a Good Nearest Neighbor: Practical Content Moderation and Text Classification
par: Bates, Luke, et autres
Publié: (2023)
par: Bates, Luke, et autres
Publié: (2023)
LLM Roleplay: Simulating Human-Chatbot Interaction
par: Tamoyan, Hovhannes, et autres
Publié: (2024)
par: Tamoyan, Hovhannes, et autres
Publié: (2024)
Re3: A Holistic Framework and Dataset for Modeling Collaborative Document Revision
par: Ruan, Qian, et autres
Publié: (2024)
par: Ruan, Qian, et autres
Publié: (2024)
DARA: Decomposition-Alignment-Reasoning Autonomous Language Agent for Question Answering over Knowledge Graphs
par: Fang, Haishuo, et autres
Publié: (2024)
par: Fang, Haishuo, et autres
Publié: (2024)
ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services
par: Ji, Fengxian, et autres
Publié: (2026)
par: Ji, Fengxian, et autres
Publié: (2026)
Hierarchical Latent Structures in Data Generation Process Unify Mechanistic Phenomena across Scale
par: Rohweder, Jonas, et autres
Publié: (2026)
par: Rohweder, Jonas, et autres
Publié: (2026)
Vision-Language Reasoning for Geolocalization: A Reinforcement Learning Approach
par: Wu, Biao, et autres
Publié: (2026)
par: Wu, Biao, et autres
Publié: (2026)
Multimodal Large Language Models to Support Real-World Fact-Checking
par: Geng, Jiahui, et autres
Publié: (2024)
par: Geng, Jiahui, et autres
Publié: (2024)
SpaRC and SpaRP: Spatial Reasoning Characterization and Path Generation for Understanding Spatial Reasoning Capability of Large Language Models
par: Rizvi, Md Imbesat Hassan, et autres
Publié: (2024)
par: Rizvi, Md Imbesat Hassan, et autres
Publié: (2024)
ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety
par: Bates, Luke, et autres
Publié: (2025)
par: Bates, Luke, et autres
Publié: (2025)
PeerQA: A Scientific Question Answering Dataset from Peer Reviews
par: Baumgärtner, Tim, et autres
Publié: (2025)
par: Baumgärtner, Tim, et autres
Publié: (2025)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
par: Jiang, Siyang, et autres
Publié: (2025)
par: Jiang, Siyang, et autres
Publié: (2025)
Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling
par: Tamoyan, Hovhannes, et autres
Publié: (2025)
par: Tamoyan, Hovhannes, et autres
Publié: (2025)
Self-Rationalization in the Wild: A Large Scale Out-of-Distribution Evaluation on NLI-related tasks
par: Yang, Jing, et autres
Publié: (2025)
par: Yang, Jing, et autres
Publié: (2025)
Preemptive Detection and Correction of Misaligned Actions in LLM Agents
par: Fang, Haishuo, et autres
Publié: (2024)
par: Fang, Haishuo, et autres
Publié: (2024)
FineState-Bench: A Comprehensive Benchmark for Fine-Grained State Control in GUI Agents
par: Ji, Fengxian, et autres
Publié: (2025)
par: Ji, Fengxian, et autres
Publié: (2025)
Attribute or Abstain: Large Language Models as Long Document Assistants
par: Buchmann, Jan, et autres
Publié: (2024)
par: Buchmann, Jan, et autres
Publié: (2024)
Robust Utility-Preserving Text Anonymization Based on Large Language Models
par: Yang, Tianyu, et autres
Publié: (2024)
par: Yang, Tianyu, et autres
Publié: (2024)
Citation Failure: Definition, Analysis and Efficient Mitigation
par: Buchmann, Jan, et autres
Publié: (2025)
par: Buchmann, Jan, et autres
Publié: (2025)
SciCoQA: Quality Assurance for Scientific Paper--Code Alignment
par: Baumgärtner, Tim, et autres
Publié: (2026)
par: Baumgärtner, Tim, et autres
Publié: (2026)
Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors
par: Daheim, Nico, et autres
Publié: (2024)
par: Daheim, Nico, et autres
Publié: (2024)
FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting
par: Ji, Fengxian, et autres
Publié: (2026)
par: Ji, Fengxian, et autres
Publié: (2026)
Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI
par: Wang, Yuxia, et autres
Publié: (2025)
par: Wang, Yuxia, et autres
Publié: (2025)
Semantic, Orthographic, and Phonological Biases in Humans' Wordle Gameplay
par: Liang, Jiadong, et autres
Publié: (2024)
par: Liang, Jiadong, et autres
Publié: (2024)
Are Large Language Models Good Classifiers? A Study on Edit Intent Classification in Scientific Document Revisions
par: Ruan, Qian, et autres
Publié: (2024)
par: Ruan, Qian, et autres
Publié: (2024)
Socratic Reasoning Improves Positive Text Rewriting
par: Goel, Anmol, et autres
Publié: (2024)
par: Goel, Anmol, et autres
Publié: (2024)
The Lou Dataset -- Exploring the Impact of Gender-Fair Language in German Text Classification
par: Waldis, Andreas, et autres
Publié: (2024)
par: Waldis, Andreas, et autres
Publié: (2024)
Analyzing Dataset Annotation Quality Management in the Wild
par: Klie, Jan-Christoph, et autres
Publié: (2023)
par: Klie, Jan-Christoph, et autres
Publié: (2023)
Diversity Over Size: On the Effect of Sample and Topic Sizes for Topic-Dependent Argument Mining Datasets
par: Schiller, Benjamin, et autres
Publié: (2022)
par: Schiller, Benjamin, et autres
Publié: (2022)
pixelLOG: Logging of Online Gameplay for Cognitive Research
par: Lu, Zeyu, et autres
Publié: (2026)
par: Lu, Zeyu, et autres
Publié: (2026)
Commitment Checklist: Auditing Author Commitments in Peer Review
par: Chen, Chung-Chi, et autres
Publié: (2026)
par: Chen, Chung-Chi, et autres
Publié: (2026)
Documents similaires
-
M4FC: a Multimodal, Multilingual, Multicultural, Multitask Real-World Fact-Checking Dataset
par: Geng, Jiahui, et autres
Publié: (2025) -
COVE: COntext and VEracity prediction for out-of-context images
par: Tonglet, Jonathan, et autres
Publié: (2025) -
"Image, Tell me your story!" Predicting the original meta-context of visual misinformation
par: Tonglet, Jonathan, et autres
Publié: (2024) -
Is this chart lying to me? Automating the detection of misleading visualizations
par: Tonglet, Jonathan, et autres
Publié: (2025) -
NewsRECON: News article REtrieval for image CONtextualization
par: Tonglet, Jonathan, et autres
Publié: (2026)