Enregistré dans:
| Auteurs principaux: | Zhou, Yuyin, Li, Xianhang, Liu, Fengze, Wei, Qingyue, Chen, Xuxi, Yu, Lequan, Xie, Cihang, Lungren, Matthew P., Xing, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2202.04291 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
3D-TransUNet for Brain Metastases Segmentation in the BraTS2023 Challenge
par: Yang, Siwei, et autres
Publié: (2024)
par: Yang, Siwei, et autres
Publié: (2024)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
par: Liu, Yanqing, et autres
Publié: (2025)
par: Liu, Yanqing, et autres
Publié: (2025)
Scaling White-Box Transformers for Vision
par: Yang, Jinrui, et autres
Publié: (2024)
par: Yang, Jinrui, et autres
Publié: (2024)
MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine
par: Xie, Yunfei, et autres
Publié: (2024)
par: Xie, Yunfei, et autres
Publié: (2024)
Revisiting Adversarial Training at Scale
par: Wang, Zeyu, et autres
Publié: (2024)
par: Wang, Zeyu, et autres
Publié: (2024)
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
par: Liu, Yanqing, et autres
Publié: (2024)
par: Liu, Yanqing, et autres
Publié: (2024)
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
par: Li, Xianhang, et autres
Publié: (2025)
par: Li, Xianhang, et autres
Publié: (2025)
Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-training
par: Gao, Yipeng, et autres
Publié: (2023)
par: Gao, Yipeng, et autres
Publié: (2023)
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
par: Wang, Feng, et autres
Publié: (2025)
par: Wang, Feng, et autres
Publié: (2025)
Combating Semantic Contamination in Learning with Label Noise
par: Fan, Wenxiao, et autres
Publié: (2024)
par: Fan, Wenxiao, et autres
Publié: (2024)
OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation
par: Zhang, Letian, et autres
Publié: (2026)
par: Zhang, Letian, et autres
Publié: (2026)
What If We Recaption Billions of Web Images with LLaMA-3?
par: Li, Xianhang, et autres
Publié: (2024)
par: Li, Xianhang, et autres
Publié: (2024)
$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark
par: Yang, Siwei, et autres
Publié: (2025)
par: Yang, Siwei, et autres
Publié: (2025)
Omni-MMSI: Toward Identity-attributed Social Interaction Understanding
par: Li, Xinpeng, et autres
Publié: (2026)
par: Li, Xinpeng, et autres
Publié: (2026)
GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
par: Wang, Yuhan, et autres
Publié: (2025)
par: Wang, Yuhan, et autres
Publié: (2025)
Unleashing the Potential of SAM for Medical Adaptation via Hierarchical Decoding
par: Cheng, Zhiheng, et autres
Publié: (2024)
par: Cheng, Zhiheng, et autres
Publié: (2024)
Knowledge or Reasoning? A Close Look at How LLMs Think Across Domains
par: Wu, Juncheng, et autres
Publié: (2025)
par: Wu, Juncheng, et autres
Publié: (2025)
Mamba-R: Vision Mamba ALSO Needs Registers
par: Wang, Feng, et autres
Publié: (2024)
par: Wang, Feng, et autres
Publié: (2024)
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
par: Wang, Feng, et autres
Publié: (2024)
par: Wang, Feng, et autres
Publié: (2024)
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
par: Xiao, Junfei, et autres
Publié: (2023)
par: Xiao, Junfei, et autres
Publié: (2023)
ARFlow: Autoregressive Flow with Hybrid Linear Attention
par: Hui, Mude, et autres
Publié: (2025)
par: Hui, Mude, et autres
Publié: (2025)
Multi-sensor Learning Enables Information Transfer across Different Sensory Data and Augments Multi-modality Imaging
par: Zhu, Lingting, et autres
Publié: (2024)
par: Zhu, Lingting, et autres
Publié: (2024)
HybridMIM: A Hybrid Masked Image Modeling Framework for 3D Medical Image Segmentation
par: Xing, Zhaohu, et autres
Publié: (2023)
par: Xing, Zhaohu, et autres
Publié: (2023)
Adaptive NNs asymptotic tracking control for high‐order nonlinear systems under prescribed performance and asymmetric output constraints
par: Kun Jiang, et autres
Publié: (2024)
par: Kun Jiang, et autres
Publié: (2024)
SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
par: Chen, Hardy, et autres
Publié: (2025)
par: Chen, Hardy, et autres
Publié: (2025)
A Unified and Controllable Framework for Layered Image Generation with Visual Effects
par: Yang, Jinrui, et autres
Publié: (2026)
par: Yang, Jinrui, et autres
Publié: (2026)
ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
par: Hui, Mude, et autres
Publié: (2024)
par: Hui, Mude, et autres
Publié: (2024)
Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
par: Wang, Zijun, et autres
Publié: (2026)
par: Wang, Zijun, et autres
Publié: (2026)
Navigation as Attackers Wish? Towards Building Robust Embodied Agents under Federated Learning
par: Zhang, Yunchao, et autres
Publié: (2022)
par: Zhang, Yunchao, et autres
Publié: (2022)
Target-Oriented Pretraining Data Selection via Neuron-Activated Graph
par: Wang, Zijun, et autres
Publié: (2026)
par: Wang, Zijun, et autres
Publié: (2026)
A Preliminary Study of o1 in Medicine: Are We Closer to an AI Doctor?
par: Xie, Yunfei, et autres
Publié: (2024)
par: Xie, Yunfei, et autres
Publié: (2024)
Combating Label Noise With A General Surrogate Model For Sample Selection
par: Liang, Chao, et autres
Publié: (2023)
par: Liang, Chao, et autres
Publié: (2023)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
On the Adversarial Robustness of Camera-based 3D Object Detection
par: Xie, Shaoyuan, et autres
Publié: (2023)
par: Xie, Shaoyuan, et autres
Publié: (2023)
A Robust Transformer–Based Error Compensation Method for Gyroscope of IMUs
par: Xin Ye, et autres
Publié: (2025)
par: Xin Ye, et autres
Publié: (2025)
PLReMix: Combating Noisy Labels with Pseudo-Label Relaxed Contrastive Representation Learning
par: Liu, Xiaoyu, et autres
Publié: (2024)
par: Liu, Xiaoyu, et autres
Publié: (2024)
Context-driven Missing-Modality Learning for Robust Medical Diagnosis with Image-Tabular Data
par: Liu, Tianling, et autres
Publié: (2026)
par: Liu, Tianling, et autres
Publié: (2026)
FedRGL: Robust Federated Graph Learning for Label Noise
par: Li, De, et autres
Publié: (2024)
par: Li, De, et autres
Publié: (2024)
Hide and Seek in Noise Labels: Noise-Robust Collaborative Active Learning with LLM-Powered Assistance
par: Yuan, Bo, et autres
Publié: (2025)
par: Yuan, Bo, et autres
Publié: (2025)
Documents similaires
-
3D-TransUNet for Brain Metastases Segmentation in the BraTS2023 Challenge
par: Yang, Siwei, et autres
Publié: (2024) -
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
par: Liu, Yanqing, et autres
Publié: (2025) -
Scaling White-Box Transformers for Vision
par: Yang, Jinrui, et autres
Publié: (2024) -
MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine
par: Xie, Yunfei, et autres
Publié: (2024) -
Revisiting Adversarial Training at Scale
par: Wang, Zeyu, et autres
Publié: (2024)