Guardado en:
| Autores principales: | Wang, Rongsheng, Wu, Minghao, Zhou, Hongru, Yu, Zhihan, Cai, Zhenyang, Chen, Junying, Wang, Benyou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2603.00585 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
por: Wang, Rongsheng, et al.
Publicado: (2025)
por: Wang, Rongsheng, et al.
Publicado: (2025)
Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging
por: Cai, Zhenyang, et al.
Publicado: (2024)
por: Cai, Zhenyang, et al.
Publicado: (2024)
ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
por: Chen, Junying, et al.
Publicado: (2025)
por: Chen, Junying, et al.
Publicado: (2025)
ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
por: Chen, Junying, et al.
Publicado: (2025)
por: Chen, Junying, et al.
Publicado: (2025)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
por: Chen, Junying, et al.
Publicado: (2024)
por: Chen, Junying, et al.
Publicado: (2024)
LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture
por: Wang, Xidong, et al.
Publicado: (2024)
por: Wang, Xidong, et al.
Publicado: (2024)
UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
por: Liu, Mingxuan, et al.
Publicado: (2025)
por: Liu, Mingxuan, et al.
Publicado: (2025)
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
por: Lai, Zhengzhao, et al.
Publicado: (2025)
por: Lai, Zhengzhao, et al.
Publicado: (2025)
A Benchmark for Incremental Micro-expression Recognition
por: Lai, Zhengqin, et al.
Publicado: (2025)
por: Lai, Zhengqin, et al.
Publicado: (2025)
DreamSAC: Learning Hamiltonian World Models via Symmetry Exploration
por: Tang, Jinzhou, et al.
Publicado: (2026)
por: Tang, Jinzhou, et al.
Publicado: (2026)
Virgo: A Preliminary Exploration on Reproducing o1-like MLLM
por: Du, Yifan, et al.
Publicado: (2025)
por: Du, Yifan, et al.
Publicado: (2025)
ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling
por: Zhu, Jiayi, et al.
Publicado: (2026)
por: Zhu, Jiayi, et al.
Publicado: (2026)
Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction
por: Chen, Weiming, et al.
Publicado: (2026)
por: Chen, Weiming, et al.
Publicado: (2026)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
por: Wang, Zhenzhi, et al.
Publicado: (2025)
por: Wang, Zhenzhi, et al.
Publicado: (2025)
HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
por: Chen, Junying, et al.
Publicado: (2024)
por: Chen, Junying, et al.
Publicado: (2024)
VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control
por: Zheng, Sixiao, et al.
Publicado: (2026)
por: Zheng, Sixiao, et al.
Publicado: (2026)
WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark
por: Lin, Wang, et al.
Publicado: (2026)
por: Lin, Wang, et al.
Publicado: (2026)
TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis
por: Chen, Shunian, et al.
Publicado: (2025)
por: Chen, Shunian, et al.
Publicado: (2025)
Adv-CPG: A Customized Portrait Generation Framework with Facial Adversarial Attacks
por: Wang, Junying, et al.
Publicado: (2025)
por: Wang, Junying, et al.
Publicado: (2025)
MA-Bench: Towards Fine-grained Micro-Action Understanding
por: Li, Kun, et al.
Publicado: (2026)
por: Li, Kun, et al.
Publicado: (2026)
Boosting Generalizability towards Zero-Shot Cross-Dataset Single-Image Indoor Depth by Meta-Initialization
por: Wu, Cho-Ying, et al.
Publicado: (2024)
por: Wu, Cho-Ying, et al.
Publicado: (2024)
NutritionVerse: Empirical Study of Various Dietary Intake Estimation Approaches
por: Tai, Chi-en Amy, et al.
Publicado: (2023)
por: Tai, Chi-en Amy, et al.
Publicado: (2023)
A Preliminary Exploration Towards General Image Restoration
por: Kong, Xiangtao, et al.
Publicado: (2024)
por: Kong, Xiangtao, et al.
Publicado: (2024)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
por: Cai, Zhenyang, et al.
Publicado: (2025)
por: Cai, Zhenyang, et al.
Publicado: (2025)
Latent Bias Alignment for High-Fidelity Diffusion Inversion in Real-World Image Reconstruction and Manipulation
por: Chen, Weiming, et al.
Publicado: (2026)
por: Chen, Weiming, et al.
Publicado: (2026)
Prototype Learning for Micro-gesture Classification
por: Chen, Guoliang, et al.
Publicado: (2024)
por: Chen, Guoliang, et al.
Publicado: (2024)
EditWorld: Simulating World Dynamics for Instruction-Following Image Editing
por: Yang, Ling, et al.
Publicado: (2024)
por: Yang, Ling, et al.
Publicado: (2024)
DRRNet: Macro-Micro Feature Fusion and Dual Reverse Refinement for Camouflaged Object Detection
por: Sun, Jianlin, et al.
Publicado: (2025)
por: Sun, Jianlin, et al.
Publicado: (2025)
DeepVerse: 4D Autoregressive Video Generation as a World Model
por: Chen, Junyi, et al.
Publicado: (2025)
por: Chen, Junyi, et al.
Publicado: (2025)
Towards Multi-dimensional Explanation Alignment for Medical Classification
por: Hu, Lijie, et al.
Publicado: (2024)
por: Hu, Lijie, et al.
Publicado: (2024)
Towards Efficient Diffusion-Based Image Editing with Instant Attention Masks
por: Zou, Siyu, et al.
Publicado: (2024)
por: Zou, Siyu, et al.
Publicado: (2024)
Sekai: A Video Dataset towards World Exploration
por: Li, Zhen, et al.
Publicado: (2025)
por: Li, Zhen, et al.
Publicado: (2025)
MetaScope: Optics-Driven Neural Network for Ultra-Micro Metalens Endoscopy
por: Li, Wuyang, et al.
Publicado: (2025)
por: Li, Wuyang, et al.
Publicado: (2025)
Prompt Group-Aware Training for Robust Text-Guided Nuclei Segmentation
por: Wu, Yonghuang, et al.
Publicado: (2026)
por: Wu, Yonghuang, et al.
Publicado: (2026)
Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis
por: Chen, Weiming, et al.
Publicado: (2025)
por: Chen, Weiming, et al.
Publicado: (2025)
Runge-Kutta Approximation and Decoupled Attention for Rectified Flow Inversion and Semantic Editing
por: Chen, Weiming, et al.
Publicado: (2025)
por: Chen, Weiming, et al.
Publicado: (2025)
MicroAUNet: Boundary-Enhanced Multi-scale Fusion with Knowledge Distillation for Colonoscopy Polyp Image Segmentation
por: Wang, Ziyi, et al.
Publicado: (2025)
por: Wang, Ziyi, et al.
Publicado: (2025)
MM-Gesture: Towards Precise Micro-Gesture Recognition through Multimodal Fusion
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World
por: Wang, Changpeng, et al.
Publicado: (2026)
por: Wang, Changpeng, et al.
Publicado: (2026)
MicroDiffusion: Implicit Representation-Guided Diffusion for 3D Reconstruction from Limited 2D Microscopy Projections
por: Hui, Mude, et al.
Publicado: (2024)
por: Hui, Mude, et al.
Publicado: (2024)
Ejemplares similares
-
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
por: Wang, Rongsheng, et al.
Publicado: (2025) -
Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging
por: Cai, Zhenyang, et al.
Publicado: (2024) -
ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
por: Chen, Junying, et al.
Publicado: (2025) -
ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
por: Chen, Junying, et al.
Publicado: (2025) -
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
por: Chen, Junying, et al.
Publicado: (2024)