OpenSeal: Good, Fast, and Cheap Construction of an Open-Source Southeast Asian LLM via Parallel Data
Fuente:
arXiv
Guardado en:
| Autores principales: | Nguyen, Tan Sang, Qorib, Muhammad Reza, Ng, Hwee Tou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Just Go Parallel: Improving the Multilingual Capabilities of Large Language Models
por: Qorib, Muhammad Reza, et al.
Publicado: (2025)
por: Qorib, Muhammad Reza, et al.
Publicado: (2025)
Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data
por: Kusuma, Christopher Adrian, et al.
Publicado: (2026)
por: Kusuma, Christopher Adrian, et al.
Publicado: (2026)
Just What You Desire: Constrained Timeline Summarization with Self-Reflection for Enhanced Relevance
por: Qorib, Muhammad Reza, et al.
Publicado: (2024)
por: Qorib, Muhammad Reza, et al.
Publicado: (2024)
Efficient and Interpretable Grammatical Error Correction with Mixture of Experts
por: Qorib, Muhammad Reza, et al.
Publicado: (2024)
por: Qorib, Muhammad Reza, et al.
Publicado: (2024)
Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
por: Li, Junyi, et al.
Publicado: (2025)
por: Li, Junyi, et al.
Publicado: (2025)
Towards Robust Temporal Reasoning of Large Language Models via a Multi-Hop QA Dataset and Pseudo-Instruction Tuning
por: Tan, Qingyu, et al.
Publicado: (2023)
por: Tan, Qingyu, et al.
Publicado: (2023)
SlideTailor: Personalized Presentation Slide Generation for Scientific Papers
por: Zeng, Wenzheng, et al.
Publicado: (2025)
por: Zeng, Wenzheng, et al.
Publicado: (2025)
Think&Cite: Improving Attributed Text Generation with Self-Guided Tree Search and Progress Reward Modeling
por: Li, Junyi, et al.
Publicado: (2024)
por: Li, Junyi, et al.
Publicado: (2024)
Preference-Guided Reflective Sampling for Aligning Language Models
por: Ye, Hai, et al.
Publicado: (2024)
por: Ye, Hai, et al.
Publicado: (2024)
Self-Judge: Selective Instruction Following with Alignment Self-Evaluation
por: Ye, Hai, et al.
Publicado: (2024)
por: Ye, Hai, et al.
Publicado: (2024)
Game of Thought: Robust Information Seeking with Large Language Models Using Game Theory
por: Cui, Langyuan, et al.
Publicado: (2026)
por: Cui, Langyuan, et al.
Publicado: (2026)
FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection
por: Ouyang, Mingyu, et al.
Publicado: (2026)
por: Ouyang, Mingyu, et al.
Publicado: (2026)
Factorized Learning for Temporally Grounded Video-Language Models
por: Zeng, Wenzheng, et al.
Publicado: (2025)
por: Zeng, Wenzheng, et al.
Publicado: (2025)
Prompting and Fine-Tuning Open-Sourced Large Language Models for Stance Classification
por: Cruickshank, Iain J., et al.
Publicado: (2023)
por: Cruickshank, Iain J., et al.
Publicado: (2023)
IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation
por: Tran, Khanh-Tung, et al.
Publicado: (2025)
por: Tran, Khanh-Tung, et al.
Publicado: (2025)
Multi-Agent Sampling: Scaling Inference Compute for Data Synthesis with Tree Search-Based Agentic Collaboration
por: Ye, Hai, et al.
Publicado: (2024)
por: Ye, Hai, et al.
Publicado: (2024)
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
por: Du, Yuwen, et al.
Publicado: (2026)
por: Du, Yuwen, et al.
Publicado: (2026)
ViSoLex: An Open-Source Repository for Vietnamese Social Media Lexical Normalization
por: Nguyen, Anh Thi-Hoang, et al.
Publicado: (2025)
por: Nguyen, Anh Thi-Hoang, et al.
Publicado: (2025)
SEALGuard: Safeguarding the Multilingual Conversations in Southeast Asian Languages for LLM Software Systems
por: Shan, Wenliang, et al.
Publicado: (2025)
por: Shan, Wenliang, et al.
Publicado: (2025)
MiniLingua: A Small Open-Source LLM for European Languages
por: Aksenova, Anna, et al.
Publicado: (2025)
por: Aksenova, Anna, et al.
Publicado: (2025)
An Open Source Data Contamination Report for Large Language Models
por: Li, Yucheng, et al.
Publicado: (2023)
por: Li, Yucheng, et al.
Publicado: (2023)
F2LLM Technical Report: Matching SOTA Embedding Performance with 6 Million Open-Source Data
por: Zhang, Ziyin, et al.
Publicado: (2025)
por: Zhang, Ziyin, et al.
Publicado: (2025)
Finding the Sweet Spot: Preference Data Construction for Scaling Preference Optimization
por: Xiao, Yao, et al.
Publicado: (2025)
por: Xiao, Yao, et al.
Publicado: (2025)
Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks
por: Warner, Benjamin, et al.
Publicado: (2026)
por: Warner, Benjamin, et al.
Publicado: (2026)
The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition
por: Tan, Yuwen, et al.
Publicado: (2025)
por: Tan, Yuwen, et al.
Publicado: (2025)
SEADialogues: A Multilingual Culturally Grounded Multi-turn Dialogue Dataset on Southeast Asian Languages
por: Kautsar, Muhammad Dehan Al, et al.
Publicado: (2025)
por: Kautsar, Muhammad Dehan Al, et al.
Publicado: (2025)
OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data
por: Toshniwal, Shubham, et al.
Publicado: (2024)
por: Toshniwal, Shubham, et al.
Publicado: (2024)
Edu-ConvoKit: An Open-Source Library for Education Conversation Data
por: Wang, Rose E., et al.
Publicado: (2024)
por: Wang, Rose E., et al.
Publicado: (2024)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
por: Wang, Jun, et al.
Publicado: (2024)
por: Wang, Jun, et al.
Publicado: (2024)
OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation
por: Lage, Lucas Fonseca, et al.
Publicado: (2025)
por: Lage, Lucas Fonseca, et al.
Publicado: (2025)
LLM-Based Section Identifiers Excel on Open Source but Stumble in Real World Applications
por: Krishnamoorthy, Saranya, et al.
Publicado: (2024)
por: Krishnamoorthy, Saranya, et al.
Publicado: (2024)
Aqulia-Med LLM: Pioneering Full-Process Open-Source Medical Language Models
por: Zhao, Lulu, et al.
Publicado: (2024)
por: Zhao, Lulu, et al.
Publicado: (2024)
DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
por: DeepSeek-AI, et al.
Publicado: (2024)
por: DeepSeek-AI, et al.
Publicado: (2024)
Is Open Source the Future of AI? A Data-Driven Approach
por: Vake, Domen, et al.
Publicado: (2025)
por: Vake, Domen, et al.
Publicado: (2025)
Fabricator: An Open Source Toolkit for Generating Labeled Training Data with Teacher LLMs
por: Golde, Jonas, et al.
Publicado: (2023)
por: Golde, Jonas, et al.
Publicado: (2023)
Steel-LLM:From Scratch to Open Source -- A Personal Journey in Building a Chinese-Centric LLM
por: Gu, Qingshui, et al.
Publicado: (2025)
por: Gu, Qingshui, et al.
Publicado: (2025)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
por: Fu, Chaoyou, et al.
Publicado: (2024)
por: Fu, Chaoyou, et al.
Publicado: (2024)
Agent-UniRAG: A Trainable Open-Source LLM Agent Framework for Unified Retrieval-Augmented Generation Systems
por: Pham, Hoang, et al.
Publicado: (2025)
por: Pham, Hoang, et al.
Publicado: (2025)
SEA-HELM: Southeast Asian Holistic Evaluation of Language Models
por: Susanto, Yosephine, et al.
Publicado: (2025)
por: Susanto, Yosephine, et al.
Publicado: (2025)
Orchard: An Open-Source Agentic Modeling Framework
por: Peng, Baolin, et al.
Publicado: (2026)
por: Peng, Baolin, et al.
Publicado: (2026)
Ejemplares similares
-
Just Go Parallel: Improving the Multilingual Capabilities of Large Language Models
por: Qorib, Muhammad Reza, et al.
Publicado: (2025) -
Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data
por: Kusuma, Christopher Adrian, et al.
Publicado: (2026) -
Just What You Desire: Constrained Timeline Summarization with Self-Reflection for Enhanced Relevance
por: Qorib, Muhammad Reza, et al.
Publicado: (2024) -
Efficient and Interpretable Grammatical Error Correction with Mixture of Experts
por: Qorib, Muhammad Reza, et al.
Publicado: (2024) -
Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
por: Li, Junyi, et al.
Publicado: (2025)