GENIUS: Generative Fluid Intelligence Evaluation Suite
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | An, Ruichuan, Yang, Sihan, Guo, Ziyu, Dai, Wei, Shen, Zijun, Li, Haodong, Zhang, Renrui, Wei, Xinyu, Li, Guopeng, Wu, Wenshan, Zhang, Wentao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning
par: Shen, Zijun, et autres
Publié: (2026)
par: Shen, Zijun, et autres
Publié: (2026)
UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens
par: An, Ruichuan, et autres
Publié: (2025)
par: An, Ruichuan, et autres
Publié: (2025)
PEARL: Personalized Streaming Video Understanding Model
par: Zheng, Yuanhong, et autres
Publié: (2026)
par: Zheng, Yuanhong, et autres
Publié: (2026)
Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
par: Lin, Weifeng, et autres
Publié: (2025)
par: Lin, Weifeng, et autres
Publié: (2025)
Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs
par: An, Ruichuan, et autres
Publié: (2025)
par: An, Ruichuan, et autres
Publié: (2025)
GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
par: Li, Bozhou, et autres
Publié: (2025)
par: Li, Bozhou, et autres
Publié: (2025)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2025)
par: An, Ruichuan, et autres
Publié: (2025)
VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction
par: Zhu, Kaixin, et autres
Publié: (2026)
par: Zhu, Kaixin, et autres
Publié: (2026)
Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
par: Tong, Chengzhuo, et autres
Publié: (2025)
par: Tong, Chengzhuo, et autres
Publié: (2025)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
MME-CoF-Pro: Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints
par: Qi, Yu, et autres
Publié: (2026)
par: Qi, Yu, et autres
Publié: (2026)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2024)
par: An, Ruichuan, et autres
Publié: (2024)
GEBench: Benchmarking Image Generation Models as GUI Environments
par: Li, Haodong, et autres
Publié: (2026)
par: Li, Haodong, et autres
Publié: (2026)
IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models
par: Lei, Jiayi, et autres
Publié: (2025)
par: Lei, Jiayi, et autres
Publié: (2025)
DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
par: Jiang, Dongzhi, et autres
Publié: (2025)
par: Jiang, Dongzhi, et autres
Publié: (2025)
MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
par: Zhang, Renrui, et autres
Publié: (2024)
par: Zhang, Renrui, et autres
Publié: (2024)
GENIUS: A Generative Framework for Universal Multimodal Search
par: Kim, Sungyeon, et autres
Publié: (2025)
par: Kim, Sungyeon, et autres
Publié: (2025)
Adaptive Classifier-Free Guidance via Dynamic Low-Confidence Masking
par: Li, Pengxiang, et autres
Publié: (2025)
par: Li, Pengxiang, et autres
Publié: (2025)
SpikeGen: Decoupled "Rods and Cones" Visual Representation Processing with Latent Generative Framework
par: Dai, Gaole, et autres
Publié: (2025)
par: Dai, Gaole, et autres
Publié: (2025)
CapGeo: A Caption-Assisted Approach to Geometric Reasoning
par: Li, Yuying, et autres
Publié: (2025)
par: Li, Yuying, et autres
Publié: (2025)
Artificial Intelligence for Biomedical Video Generation
par: Li, Linyuan, et autres
Publié: (2024)
par: Li, Linyuan, et autres
Publié: (2024)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
Rethinking VLM Representation for VLA Initialization
par: Lin, Weifeng, et autres
Publié: (2026)
par: Lin, Weifeng, et autres
Publié: (2026)
Gradient-based Parameter Selection for Efficient Fine-Tuning
par: Zhang, Zhi, et autres
Publié: (2023)
par: Zhang, Zhi, et autres
Publié: (2023)
Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want
par: Lin, Weifeng, et autres
Publié: (2024)
par: Lin, Weifeng, et autres
Publié: (2024)
NTO3D: Neural Target Object 3D Reconstruction with Segment Anything
par: Wei, Xiaobao, et autres
Publié: (2023)
par: Wei, Xiaobao, et autres
Publié: (2023)
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
par: Zhang, Fan, et autres
Publié: (2025)
par: Zhang, Fan, et autres
Publié: (2025)
Energy Score-based Pseudo-Label Filtering and Adaptive Loss for Imbalanced Semi-supervised SAR target recognition
par: Zhang, Xinzheng, et autres
Publié: (2024)
par: Zhang, Xinzheng, et autres
Publié: (2024)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
par: Li, Haodong, et autres
Publié: (2024)
par: Li, Haodong, et autres
Publié: (2024)
T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
par: Jiang, Dongzhi, et autres
Publié: (2025)
par: Jiang, Dongzhi, et autres
Publié: (2025)
SAM2Point: Segment Any 3D as Videos in Zero-shot and Promptable Manners
par: Guo, Ziyu, et autres
Publié: (2024)
par: Guo, Ziyu, et autres
Publié: (2024)
UDTIRI: An Online Open-Source Intelligent Road Inspection Benchmark Suite
par: Guo, Sicen, et autres
Publié: (2023)
par: Guo, Sicen, et autres
Publié: (2023)
CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark
par: Wang, Wei, et autres
Publié: (2026)
par: Wang, Wei, et autres
Publié: (2026)
Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing
par: Zhang, Huanyu, et autres
Publié: (2026)
par: Zhang, Huanyu, et autres
Publié: (2026)
DISCO: Document Intelligence Suite for COmparative Evaluation
par: Benkirane, Kenza, et autres
Publié: (2026)
par: Benkirane, Kenza, et autres
Publié: (2026)
CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation
par: Tong, Chengzhuo, et autres
Publié: (2026)
par: Tong, Chengzhuo, et autres
Publié: (2026)
LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
par: Li, Feng, et autres
Publié: (2024)
par: Li, Feng, et autres
Publié: (2024)
The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
par: Li, Bozhou, et autres
Publié: (2025)
par: Li, Bozhou, et autres
Publié: (2025)
ViDA: Homeostatic Visual Domain Adapter for Continual Test Time Adaptation
par: Liu, Jiaming, et autres
Publié: (2023)
par: Liu, Jiaming, et autres
Publié: (2023)
Documents similaires
-
Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning
par: Shen, Zijun, et autres
Publié: (2026) -
UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens
par: An, Ruichuan, et autres
Publié: (2025) -
PEARL: Personalized Streaming Video Understanding Model
par: Zheng, Yuanhong, et autres
Publié: (2026) -
Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
par: Lin, Weifeng, et autres
Publié: (2025) -
Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs
par: An, Ruichuan, et autres
Publié: (2025)