MMGeoLM: Hard Negative Contrastive Learning for Fine-Grained Geometric Understanding in Large Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Kai, Bai, Yushi, Yang, Zhen, Zhang, Jiajie, Qi, Ji, Hou, Lei, Li, Juanzi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
par: Sun, Kai, et autres
Publié: (2024)
par: Sun, Kai, et autres
Publié: (2024)
LongAlign: A Recipe for Long Context Alignment of Large Language Models
par: Bai, Yushi, et autres
Publié: (2024)
par: Bai, Yushi, et autres
Publié: (2024)
Pre-training Distillation for Large Language Models: A Design Space Exploration
par: Peng, Hao, et autres
Publié: (2024)
par: Peng, Hao, et autres
Publié: (2024)
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2023)
par: Tu, Shangqing, et autres
Publié: (2023)
Enhancing Conceptual Understanding in Multimodal Contrastive Learning through Hard Negative Samples
par: Rösch, Philipp J., et autres
Publié: (2024)
par: Rösch, Philipp J., et autres
Publié: (2024)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
par: Chen, Jianhui, et autres
Publié: (2024)
par: Chen, Jianhui, et autres
Publié: (2024)
VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools
par: Qi, Ji, et autres
Publié: (2023)
par: Qi, Ji, et autres
Publié: (2023)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
par: Qi, Ji, et autres
Publié: (2025)
par: Qi, Ji, et autres
Publié: (2025)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
par: Lin, Nianyi, et autres
Publié: (2025)
par: Lin, Nianyi, et autres
Publié: (2025)
DeepPrune: Parallel Scaling without Inter-trace Redundancy
par: Tu, Shangqing, et autres
Publié: (2025)
par: Tu, Shangqing, et autres
Publié: (2025)
LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-context QA
par: Zhang, Jiajie, et autres
Publié: (2024)
par: Zhang, Jiajie, et autres
Publié: (2024)
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
par: Zhang, Jiajie, et autres
Publié: (2026)
par: Zhang, Jiajie, et autres
Publié: (2026)
SIRI: Scaling Iterative Reinforcement Learning with Interleaved Compression
par: Wen, Haoming, et autres
Publié: (2025)
par: Wen, Haoming, et autres
Publié: (2025)
LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMs
par: Bai, Yushi, et autres
Publié: (2024)
par: Bai, Yushi, et autres
Publié: (2024)
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
par: Bai, Yushi, et autres
Publié: (2023)
par: Bai, Yushi, et autres
Publié: (2023)
AdaptThink: Reasoning Models Can Learn When to Think
par: Zhang, Jiajie, et autres
Publié: (2025)
par: Zhang, Jiajie, et autres
Publié: (2025)
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
par: Bai, Yushi, et autres
Publié: (2024)
par: Bai, Yushi, et autres
Publié: (2024)
KB-Plugin: A Plug-and-play Framework for Large Language Models to Induce Programs over Low-resourced Knowledge Bases
par: Zhang, Jiajie, et autres
Publié: (2024)
par: Zhang, Jiajie, et autres
Publié: (2024)
SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models
par: Wu, Yuhao, et autres
Publié: (2025)
par: Wu, Yuhao, et autres
Publié: (2025)
CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning
par: Qi, Ji, et autres
Publié: (2024)
par: Qi, Ji, et autres
Publié: (2024)
ADELIE: Aligning Large Language Models on Information Extraction
par: Qi, Yunjia, et autres
Publié: (2024)
par: Qi, Yunjia, et autres
Publié: (2024)
Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
par: Bai, Tianyi, et autres
Publié: (2025)
par: Bai, Tianyi, et autres
Publié: (2025)
HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities
par: Dönmez, Esra, et autres
Publié: (2026)
par: Dönmez, Esra, et autres
Publié: (2026)
LongReward: Improving Long-context Large Language Models with AI Feedback
par: Zhang, Jiajie, et autres
Publié: (2024)
par: Zhang, Jiajie, et autres
Publié: (2024)
Enhancing Contrastive Learning for Geolocalization by Discovering Hard Negatives on Semivariograms
par: Chen, Boyi, et autres
Publié: (2025)
par: Chen, Boyi, et autres
Publié: (2025)
Locality-Sensitive Hashing for Efficient Hard Negative Sampling in Contrastive Learning
par: Deuser, Fabian, et autres
Publié: (2025)
par: Deuser, Fabian, et autres
Publié: (2025)
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
par: He, Guanzhong, et autres
Publié: (2025)
par: He, Guanzhong, et autres
Publié: (2025)
ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented Generation
par: Lee, Zhicheng, et autres
Publié: (2025)
par: Lee, Zhicheng, et autres
Publié: (2025)
LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning
par: Wu, Yuhao, et autres
Publié: (2025)
par: Wu, Yuhao, et autres
Publié: (2025)
Understanding Hyperbolic Metric Learning through Hard Negative Sampling
par: Yue, Yun, et autres
Publié: (2024)
par: Yue, Yun, et autres
Publié: (2024)
Constraint Back-translation Improves Complex Instruction Following of Large Language Models
par: Qi, Yunjia, et autres
Publié: (2024)
par: Qi, Yunjia, et autres
Publié: (2024)
Rehabilitation Exercise Quality Assessment through Supervised Contrastive Learning with Hard and Soft Negatives
par: Karlov, Mark, et autres
Publié: (2024)
par: Karlov, Mark, et autres
Publié: (2024)
HNCSE: Advancing Sentence Embeddings via Hybrid Contrastive Learning with Hard Negatives
par: Liu, Wenxiao, et autres
Publié: (2024)
par: Liu, Wenxiao, et autres
Publié: (2024)
Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
par: Deng, Haolin, et autres
Publié: (2026)
par: Deng, Haolin, et autres
Publié: (2026)
Adaptive Global and Fine-Grained Perceptual Fusion for MLLM Embeddings Compatible with Hard Negative Amplification
par: Hu, Lexiang, et autres
Publié: (2026)
par: Hu, Lexiang, et autres
Publié: (2026)
RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding
par: Sun, Muyi, et autres
Publié: (2026)
par: Sun, Muyi, et autres
Publié: (2026)
Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding
par: Zhang, Le, et autres
Publié: (2023)
par: Zhang, Le, et autres
Publié: (2023)
MAVEN-Fact: A Large-scale Event Factuality Detection Dataset
par: Li, Chunyang, et autres
Publié: (2024)
par: Li, Chunyang, et autres
Publié: (2024)
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
par: Peng, Hao, et autres
Publié: (2025)
par: Peng, Hao, et autres
Publié: (2025)
Documents similaires
-
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
par: Sun, Kai, et autres
Publié: (2024) -
LongAlign: A Recipe for Long Context Alignment of Large Language Models
par: Bai, Yushi, et autres
Publié: (2024) -
Pre-training Distillation for Large Language Models: A Design Space Exploration
par: Peng, Hao, et autres
Publié: (2024) -
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
par: Tu, Shangqing, et autres
Publié: (2024) -
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2023)