Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Tianyang, Su, Junhao, Hu, Junjie, Yang, Peizhen, Shi, Hengyu, Luo, Junfeng, Gao, Jialin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LayoutCoT: Unleashing the Deep Reasoning Potential of Large Language Models for Layout Generation
par: Shi, Hengyu, et autres
Publié: (2025)
par: Shi, Hengyu, et autres
Publié: (2025)
MAN++: Scaling Momentum Auxiliary Network for Supervised Local Learning in Vision Tasks
par: Su, Junhao, et autres
Publié: (2025)
par: Su, Junhao, et autres
Publié: (2025)
Advancing Supervised Local Learning Beyond Classification with Long-term Feature Bank
par: Zhu, Feiyu, et autres
Publié: (2024)
par: Zhu, Feiyu, et autres
Publié: (2024)
Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions
par: Su, Junhao, et autres
Publié: (2025)
par: Su, Junhao, et autres
Publié: (2025)
PositionIC: Unified Position and Identity Consistency for Image Customization
par: Hu, Junjie, et autres
Publié: (2025)
par: Hu, Junjie, et autres
Publié: (2025)
Replacement Learning: Training Neural Networks with Fewer Parameters
par: Zhang, Yuming, et autres
Publié: (2026)
par: Zhang, Yuming, et autres
Publié: (2026)
Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing
par: Zhao, Xiangyu, et autres
Publié: (2025)
par: Zhao, Xiangyu, et autres
Publié: (2025)
PosterOmni: Generalized Artistic Poster Creation via Task Distillation and Unified Reward Feedback
par: Chen, Sixiang, et autres
Publié: (2026)
par: Chen, Sixiang, et autres
Publié: (2026)
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
par: Zhang, Daoan, et autres
Publié: (2025)
par: Zhang, Daoan, et autres
Publié: (2025)
Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards
par: Han, Tianyang, et autres
Publié: (2026)
par: Han, Tianyang, et autres
Publié: (2026)
Beyond Pixels: Text Enhances Generalization in Real-World Image Restoration
par: Sun, Haoze, et autres
Publié: (2024)
par: Sun, Haoze, et autres
Publié: (2024)
HunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixels
par: HunyuanWorld Team, et autres
Publié: (2025)
par: HunyuanWorld Team, et autres
Publié: (2025)
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
par: Yang, Cheng, et autres
Publié: (2026)
par: Yang, Cheng, et autres
Publié: (2026)
Stabilizing Quantization-Aware Training by Implicit-Regularization on Hessian Matrix
par: Pang, Junbiao, et autres
Publié: (2025)
par: Pang, Junbiao, et autres
Publié: (2025)
FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning
par: Jiang, Yue, et autres
Publié: (2025)
par: Jiang, Yue, et autres
Publié: (2025)
Beyond Pixels: Medical Image Quality Assessment with Implicit Neural Representations
par: Özer, Caner, et autres
Publié: (2025)
par: Özer, Caner, et autres
Publié: (2025)
PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework
par: Chen, SiXiang, et autres
Publié: (2025)
par: Chen, SiXiang, et autres
Publié: (2025)
Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency
par: Li, Hongyu, et autres
Publié: (2025)
par: Li, Hongyu, et autres
Publié: (2025)
Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation
par: Zhang, Wenchao, et autres
Publié: (2025)
par: Zhang, Wenchao, et autres
Publié: (2025)
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
par: Chen, Yubin, et autres
Publié: (2025)
par: Chen, Yubin, et autres
Publié: (2025)
Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark
par: Hu, Jinpeng, et autres
Publié: (2025)
par: Hu, Jinpeng, et autres
Publié: (2025)
Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning
par: Xu, Yu, et autres
Publié: (2026)
par: Xu, Yu, et autres
Publié: (2026)
PixelFlow: Pixel-Space Generative Models with Flow
par: Chen, Shoufa, et autres
Publié: (2025)
par: Chen, Shoufa, et autres
Publié: (2025)
Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control
par: Han, Minghao, et autres
Publié: (2025)
par: Han, Minghao, et autres
Publié: (2025)
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
par: Wang, Haozhe, et autres
Publié: (2025)
par: Wang, Haozhe, et autres
Publié: (2025)
Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
par: Gao, Xin, et autres
Publié: (2026)
par: Gao, Xin, et autres
Publié: (2026)
PixelDiT: Pixel Diffusion Transformers for Image Generation
par: Yu, Yongsheng, et autres
Publié: (2025)
par: Yu, Yongsheng, et autres
Publié: (2025)
RiskCueBench: Benchmarking Anticipatory Reasoning from Early Risk Cues in Video-Language Models
par: Luo, Sha, et autres
Publié: (2026)
par: Luo, Sha, et autres
Publié: (2026)
Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning
par: Li, Xuchen, et autres
Publié: (2025)
par: Li, Xuchen, et autres
Publié: (2025)
PixelThink: Towards Efficient Chain-of-Pixel Reasoning
par: Wang, Song, et autres
Publié: (2025)
par: Wang, Song, et autres
Publié: (2025)
Reward-Instruct: A Reward-Centric Approach to Fast Photo-Realistic Image Generation
par: Luo, Yihong, et autres
Publié: (2025)
par: Luo, Yihong, et autres
Publié: (2025)
Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
par: Zhang, David Junhao, et autres
Publié: (2023)
par: Zhang, David Junhao, et autres
Publié: (2023)
PixelLM: Pixel Reasoning with Large Multimodal Model
par: Ren, Zhongwei, et autres
Publié: (2023)
par: Ren, Zhongwei, et autres
Publié: (2023)
From Pixels to Words -- Towards Native One-Vision Models at Scale
par: Diao, Haiwen, et autres
Publié: (2026)
par: Diao, Haiwen, et autres
Publié: (2026)
Beyond Pixel-Wise Supervision for Medical Image Segmentation: From Traditional Models to Foundation Models
par: Shi, Yuyan, et autres
Publié: (2024)
par: Shi, Yuyan, et autres
Publié: (2024)
Pixal3D: Pixel-Aligned 3D Generation from Images
par: Li, Dong-Yang, et autres
Publié: (2026)
par: Li, Dong-Yang, et autres
Publié: (2026)
Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark
par: Liu, Xinxin, et autres
Publié: (2025)
par: Liu, Xinxin, et autres
Publié: (2025)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
par: Zhang, Yuanhan, et autres
Publié: (2024)
par: Zhang, Yuanhan, et autres
Publié: (2024)
V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models
par: Luo, Yang, et autres
Publié: (2025)
par: Luo, Yang, et autres
Publié: (2025)
ANNEXE: Unified Analyzing, Answering, and Pixel Grounding for Egocentric Interaction
par: Su, Yuejiao, et autres
Publié: (2025)
par: Su, Yuejiao, et autres
Publié: (2025)
Documents similaires
-
LayoutCoT: Unleashing the Deep Reasoning Potential of Large Language Models for Layout Generation
par: Shi, Hengyu, et autres
Publié: (2025) -
MAN++: Scaling Momentum Auxiliary Network for Supervised Local Learning in Vision Tasks
par: Su, Junhao, et autres
Publié: (2025) -
Advancing Supervised Local Learning Beyond Classification with Long-term Feature Bank
par: Zhu, Feiyu, et autres
Publié: (2024) -
Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions
par: Su, Junhao, et autres
Publié: (2025) -
PositionIC: Unified Position and Identity Consistency for Image Customization
par: Hu, Junjie, et autres
Publié: (2025)