Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
Fuente:
arXiv
Guardado en:
| Autores principales: | Liang, Hao, Wu, Ruitao, Zeng, Bohan, Niu, Junbo, Zhang, Wentao, Dong, Bin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
por: Xiang, Kun, et al.
Publicado: (2025)
por: Xiang, Kun, et al.
Publicado: (2025)
SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning
por: Xiang, Kun, et al.
Publicado: (2026)
por: Xiang, Kun, et al.
Publicado: (2026)
1st Place Solution to the 1st SkatingVerse Challenge
por: Sun, Tao, et al.
Publicado: (2024)
por: Sun, Tao, et al.
Publicado: (2024)
PhysBrain 1.0 Technical Report
por: Lian, Shijie, et al.
Publicado: (2026)
por: Lian, Shijie, et al.
Publicado: (2026)
Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
por: Long, Lin, et al.
Publicado: (2025)
por: Long, Lin, et al.
Publicado: (2025)
1st Place Solution of Multiview Egocentric Hand Tracking Challenge ECCV2024
por: Zou, Minqiang, et al.
Publicado: (2024)
por: Zou, Minqiang, et al.
Publicado: (2024)
First Place Solution to the MLCAS 2025 GWFSS Challenge: The Devil is in the Detail and Minority
por: Cao, Songliang, et al.
Publicado: (2025)
por: Cao, Songliang, et al.
Publicado: (2025)
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
por: Dong, Hejun, et al.
Publicado: (2026)
por: Dong, Hejun, et al.
Publicado: (2026)
Task adaptation of Vision-Language-Action model: 1st Place Solution for the 2025 BEHAVIOR Challenge
por: Larchenko, Ilia, et al.
Publicado: (2025)
por: Larchenko, Ilia, et al.
Publicado: (2025)
Technical Report for ICML 2024 TiFA Workshop MLLM Attack Challenge: Suffix Injection and Projected Gradient Descent Can Easily Fool An MLLM
por: Guo, Yangyang, et al.
Publicado: (2024)
por: Guo, Yangyang, et al.
Publicado: (2024)
VABench: A Comprehensive Benchmark for Audio-Video Generation
por: Hua, Daili, et al.
Publicado: (2025)
por: Hua, Daili, et al.
Publicado: (2025)
Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models
por: Niu, Junbo, et al.
Publicado: (2025)
por: Niu, Junbo, et al.
Publicado: (2025)
SAMSON: 3rd Place Solution of LSVOS 2025 VOS Challenge
por: Xie, Yujie, et al.
Publicado: (2025)
por: Xie, Yujie, et al.
Publicado: (2025)
The 1st Solution for MOSEv1 Challenge on LSVOS 2025: CGFSeg
por: Li, Tingmin, et al.
Publicado: (2025)
por: Li, Tingmin, et al.
Publicado: (2025)
Point Transformer V3 Extreme: 1st Place Solution for 2024 Waymo Open Dataset Challenge in Semantic Segmentation
por: Wu, Xiaoyang, et al.
Publicado: (2024)
por: Wu, Xiaoyang, et al.
Publicado: (2024)
1st Place Solution for 5th LSVOS Challenge: Referring Video Object Segmentation
por: Luo, Zhuoyan, et al.
Publicado: (2024)
por: Luo, Zhuoyan, et al.
Publicado: (2024)
1st Place Solution for ICCV 2023 OmniObject3D Challenge: Sparse-View Reconstruction
por: Du, Hang, et al.
Publicado: (2024)
por: Du, Hang, et al.
Publicado: (2024)
Technical Report for the 5th CLVision Challenge at CVPR: Addressing the Class-Incremental with Repetition using Unlabeled Data -- 4th Place Solution
por: Moraiti, Panagiota, et al.
Publicado: (2025)
por: Moraiti, Panagiota, et al.
Publicado: (2025)
Adapting SAM 2 for Visual Object Tracking: 1st Place Solution for MMVPR Challenge Multi-Modal Tracking
por: Yang, Cheng-Yen, et al.
Publicado: (2025)
por: Yang, Cheng-Yen, et al.
Publicado: (2025)
Discriminative Spatial-Semantic VOS Solution: 1st Place Solution for 6th LSVOS
por: Miao, Deshui, et al.
Publicado: (2024)
por: Miao, Deshui, et al.
Publicado: (2024)
X-Restormer++: 1st Place Solution for the UG2+ CVPR 2026 All-Weather Restoration Challenge
por: Pan, Youwei, et al.
Publicado: (2026)
por: Pan, Youwei, et al.
Publicado: (2026)
Multimodal Structured Generation: CVPR's 2nd MMFM Challenge Technical Report
por: Cesista, Franz Louis
Publicado: (2024)
por: Cesista, Franz Louis
Publicado: (2024)
UNINEXT-Cutie: The 1st Solution for LSVOS Challenge RVOS Track
por: Fang, Hao, et al.
Publicado: (2024)
por: Fang, Hao, et al.
Publicado: (2024)
Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025
por: Ying, Zonghao, et al.
Publicado: (2025)
por: Ying, Zonghao, et al.
Publicado: (2025)
The Instance-centric Transformer for the RVOS Track of LSVOS Challenge: 3rd Place Solution
por: Cao, Bin, et al.
Publicado: (2024)
por: Cao, Bin, et al.
Publicado: (2024)
Seeing Beyond Words: MatVQA for Challenging Visual-Scientific Reasoning in Materials Science
por: Wu, Sifan, et al.
Publicado: (2025)
por: Wu, Sifan, et al.
Publicado: (2025)
Can Multimodal LLMs See Science Instruction? Benchmarking Pedagogical Reasoning in K-12 Classroom Videos
por: Shen, Yixuan, et al.
Publicado: (2026)
por: Shen, Yixuan, et al.
Publicado: (2026)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
por: Guo, Tianyu, et al.
Publicado: (2025)
por: Guo, Tianyu, et al.
Publicado: (2025)
The 1st Solution for 4th PVUW MeViS Challenge: Unleashing the Potential of Large Multimodal Models for Referring Video Segmentation
por: Fang, Hao, et al.
Publicado: (2025)
por: Fang, Hao, et al.
Publicado: (2025)
See, Think, Learn: A Self-Taught Multimodal Reasoner
por: Sharma, Sourabh, et al.
Publicado: (2025)
por: Sharma, Sourabh, et al.
Publicado: (2025)
TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos
por: Feng, Hengyi, et al.
Publicado: (2026)
por: Feng, Hengyi, et al.
Publicado: (2026)
Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning
por: Chen, Mingrui, et al.
Publicado: (2025)
por: Chen, Mingrui, et al.
Publicado: (2025)
Towards Fine-grained Large Object Segmentation 1st Place Solution to 3D AI Challenge 2020 -- Instance Segmentation Track
por: Chen, Zehui, et al.
Publicado: (2020)
por: Chen, Zehui, et al.
Publicado: (2020)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
por: Sun, Linzhuang, et al.
Publicado: (2025)
por: Sun, Linzhuang, et al.
Publicado: (2025)
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
por: Zhou, Weijie, et al.
Publicado: (2025)
por: Zhou, Weijie, et al.
Publicado: (2025)
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
por: Zhang, Zhixiong, et al.
Publicado: (2025)
por: Zhang, Zhixiong, et al.
Publicado: (2025)
TrajTok: Technical Report for 2025 Waymo Open Sim Agents Challenge
por: Zhang, Zhiyuan, et al.
Publicado: (2025)
por: Zhang, Zhiyuan, et al.
Publicado: (2025)
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
por: Wang, Yiqi, et al.
Publicado: (2024)
por: Wang, Yiqi, et al.
Publicado: (2024)
Baichuan Alignment Technical Report
por: Lin, Mingan, et al.
Publicado: (2024)
por: Lin, Mingan, et al.
Publicado: (2024)
Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization
por: Fang, Hao, et al.
Publicado: (2026)
por: Fang, Hao, et al.
Publicado: (2026)
Ejemplares similares
-
SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
por: Xiang, Kun, et al.
Publicado: (2025) -
SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning
por: Xiang, Kun, et al.
Publicado: (2026) -
1st Place Solution to the 1st SkatingVerse Challenge
por: Sun, Tao, et al.
Publicado: (2024) -
PhysBrain 1.0 Technical Report
por: Lian, Shijie, et al.
Publicado: (2026) -
Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
por: Long, Lin, et al.
Publicado: (2025)