Multimodal Structured Generation: CVPR's 2nd MMFM Challenge Technical Report
Fuente:
arXiv
Guardado en:
| Autor principal: | Cesista, Franz Louis |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
por: Liang, Hao, et al.
Publicado: (2025)
por: Liang, Hao, et al.
Publicado: (2025)
Technique Report of CVPR 2024 PBDL Challenges
por: Fu, Ying, et al.
Publicado: (2024)
por: Fu, Ying, et al.
Publicado: (2024)
ReferDINO-Plus: 2nd Solution for 4th PVUW MeViS Challenge at CVPR 2025
por: Liang, Tianming, et al.
Publicado: (2025)
por: Liang, Tianming, et al.
Publicado: (2025)
Technical Report for CVPR 2024 WeatherProof Dataset Challenge: Semantic Segmentation on Paired Real Data
por: Cao, Guojin, et al.
Publicado: (2024)
por: Cao, Guojin, et al.
Publicado: (2024)
DIVE: Deep-search Iterative Video Exploration A Technical Report for the CVRR Challenge at CVPR 2025
por: Kamoto, Umihiro, et al.
Publicado: (2025)
por: Kamoto, Umihiro, et al.
Publicado: (2025)
Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model
por: Ma, Guoqing, et al.
Publicado: (2025)
por: Ma, Guoqing, et al.
Publicado: (2025)
Multi-Modal UAV Detection, Classification and Tracking Algorithm -- Technical Report for CVPR 2024 UG2 Challenge
por: Deng, Tianchen, et al.
Publicado: (2024)
por: Deng, Tianchen, et al.
Publicado: (2024)
Separating Drone Point Clouds From Complex Backgrounds by Cluster Filter -- Technical Report for CVPR 2024 UG2 Challenge
por: Liang, Hanfang, et al.
Publicado: (2024)
por: Liang, Hanfang, et al.
Publicado: (2024)
The System Description of CPS Team for Track on Driving with Language of CVPR 2024 Autonomous Grand Challenge
por: Peng, Jinghan, et al.
Publicado: (2025)
por: Peng, Jinghan, et al.
Publicado: (2025)
Technical Report of NICE Challenge at CVPR 2024: Caption Re-ranking Evaluation Using Ensembled CLIP and Consensus Scores
por: Jeong, Kiyoon, et al.
Publicado: (2024)
por: Jeong, Kiyoon, et al.
Publicado: (2024)
Octopus v3: Technical Report for On-device Sub-billion Multimodal AI Agent
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
Falcon2-11B Technical Report
por: Malartic, Quentin, et al.
Publicado: (2024)
por: Malartic, Quentin, et al.
Publicado: (2024)
Qwen2.5-VL Technical Report
por: Bai, Shuai, et al.
Publicado: (2025)
por: Bai, Shuai, et al.
Publicado: (2025)
VARCO-VISION-2.0 Technical Report
por: Cha, Young-rok, et al.
Publicado: (2025)
por: Cha, Young-rok, et al.
Publicado: (2025)
Privacy-Aware Camera 2.0 Technical Report
por: Song, Huan, et al.
Publicado: (2026)
por: Song, Huan, et al.
Publicado: (2026)
Arctic-Extract Technical Report
por: Chiliński, Mateusz, et al.
Publicado: (2025)
por: Chiliński, Mateusz, et al.
Publicado: (2025)
2nd Place Solution for MOSE Track in CVPR 2024 PVUW workshop: Complex Video Object Segmentation
por: Xu, Zhensong, et al.
Publicado: (2024)
por: Xu, Zhensong, et al.
Publicado: (2024)
Mano Technical Report
por: Fu, Tianyu, et al.
Publicado: (2025)
por: Fu, Tianyu, et al.
Publicado: (2025)
2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model
por: Guo, Zilong, et al.
Publicado: (2025)
por: Guo, Zilong, et al.
Publicado: (2025)
Technical Report for the 5th CLVision Challenge at CVPR: Addressing the Class-Incremental with Repetition using Unlabeled Data -- 4th Place Solution
por: Moraiti, Panagiota, et al.
Publicado: (2025)
por: Moraiti, Panagiota, et al.
Publicado: (2025)
Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Text
por: Rahman, Mizanur, et al.
Publicado: (2025)
por: Rahman, Mizanur, et al.
Publicado: (2025)
Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model
por: Huang, Haoyang, et al.
Publicado: (2025)
por: Huang, Haoyang, et al.
Publicado: (2025)
Learning the Bitter Lesson: Empirical Evidence from 20 Years of CVPR Proceedings
por: Yousefi, Mojtaba, et al.
Publicado: (2024)
por: Yousefi, Mojtaba, et al.
Publicado: (2024)
Skywork-R1V3 Technical Report
por: Shen, Wei, et al.
Publicado: (2025)
por: Shen, Wei, et al.
Publicado: (2025)
MapVision: CVPR 2024 Autonomous Grand Challenge Mapless Driving Tech Report
por: Yang, Zhongyu, et al.
Publicado: (2024)
por: Yang, Zhongyu, et al.
Publicado: (2024)
Crossing Borders: A Multimodal Challenge for Indian Poetry Translation and Image Generation
por: Jamil, Sofia, et al.
Publicado: (2025)
por: Jamil, Sofia, et al.
Publicado: (2025)
The Solution for the CVPR2024 NICE Image Captioning Challenge
por: Huang, Longfei, et al.
Publicado: (2024)
por: Huang, Longfei, et al.
Publicado: (2024)
2nd Place Solution for MeViS Track in CVPR 2024 PVUW Workshop: Motion Expression guided Video Segmentation
por: Cao, Bin, et al.
Publicado: (2024)
por: Cao, Bin, et al.
Publicado: (2024)
Docling Technical Report
por: Auer, Christoph, et al.
Publicado: (2024)
por: Auer, Christoph, et al.
Publicado: (2024)
MedGemma Technical Report
por: Sellergren, Andrew, et al.
Publicado: (2025)
por: Sellergren, Andrew, et al.
Publicado: (2025)
Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation
por: Xiang, Sike, et al.
Publicado: (2026)
por: Xiang, Sike, et al.
Publicado: (2026)
Baichuan-Omni Technical Report
por: Li, Yadong, et al.
Publicado: (2024)
por: Li, Yadong, et al.
Publicado: (2024)
MAIRA-Seg: Enhancing Radiology Report Generation with Segmentation-Aware Multimodal Large Language Models
por: Sharma, Harshita, et al.
Publicado: (2024)
por: Sharma, Harshita, et al.
Publicado: (2024)
The Solution for CVPR2024 Foundational Few-Shot Object Detection Challenge
por: Pan, Hongpeng, et al.
Publicado: (2024)
por: Pan, Hongpeng, et al.
Publicado: (2024)
CSS-Segment: 2nd Place Report of LSVOS Challenge VOS Track
por: Chai, Jinming, et al.
Publicado: (2024)
por: Chai, Jinming, et al.
Publicado: (2024)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
por: Yu, Wenwen, et al.
Publicado: (2025)
por: Yu, Wenwen, et al.
Publicado: (2025)
MAIRA-2: Grounded Radiology Report Generation
por: Bannur, Shruthi, et al.
Publicado: (2024)
por: Bannur, Shruthi, et al.
Publicado: (2024)
Pseudo-Label Enhanced Cascaded Framework: 2nd Technical Report for LSVOS 2025 VOS Track
por: Yan, An, et al.
Publicado: (2025)
por: Yan, An, et al.
Publicado: (2025)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
Ovis2.5 Technical Report
por: Lu, Shiyin, et al.
Publicado: (2025)
por: Lu, Shiyin, et al.
Publicado: (2025)
Ejemplares similares
-
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
por: Liang, Hao, et al.
Publicado: (2025) -
Technique Report of CVPR 2024 PBDL Challenges
por: Fu, Ying, et al.
Publicado: (2024) -
ReferDINO-Plus: 2nd Solution for 4th PVUW MeViS Challenge at CVPR 2025
por: Liang, Tianming, et al.
Publicado: (2025) -
Technical Report for CVPR 2024 WeatherProof Dataset Challenge: Semantic Segmentation on Paired Real Data
por: Cao, Guojin, et al.
Publicado: (2024) -
DIVE: Deep-search Iterative Video Exploration A Technical Report for the CVRR Challenge at CVPR 2025
por: Kamoto, Umihiro, et al.
Publicado: (2025)