MEA Ecosystem · Dataset Terbuka
Pustaka
Korpus teks terbuka berskala besar untuk melatih model bahasa — mencakup web, kode, matematika, instruksi, hukum, dan Wikipedia dalam lima bahasa.
idPerpustakaan terbuka untuk siapa saja.
enAn open library for everyone.
ja誰にでも開かれた図書館。
ko모두를 위한 열린 도서관.
zh面向所有人的开放图书馆。
Skala
Diukur, bukan diperkirakan
Setiap angka di sini dihitung langsung dari corpus menggunakan tokenizer Pustaka sendiri — dapat direproduksi oleh siapa saja.
~20,15B
Token (estimasi)
~31,5 Jt
Dokumen
5
Bahasa
131.072
Vocab Tokenizer
Struktur
Apa saja isinya
Tujuh kategori corpus, dikurasi dan dibersihkan dengan pipeline yang sama.
Corpus
Bahasa
Keterangan
corpus-bahasa-indonesia
id
CulturaX, Indo4B, CC-News, Wikipedia, Kaskus WebText
corpus-bahasa-indonesia-native
id
Common Crawl langsung — lisensi bersih tanpa batasan non-komersial
corpus-code
—
10 bahasa pemrograman, lisensi permissive saja
corpus-math
en
GSM8K, NuminaMath-CoT
corpus-instruct
id, en
Dolly-15k, Alpaca-cleaned-Indonesian, OIG
corpus-hukum
ja, en
Perundang-undangan Jepang dan Amerika Serikat
wikipedia
ja, ko, zh
Wikipedia multi-bahasa di luar Bahasa Indonesia
Lisensi
Bebas dipakai, termasuk komersial
Hasil kurasi Pustaka dirilis di bawah MEA Ecosystem Open License (MEA-OL) — bebas digunakan untuk keperluan apa pun dengan syarat atribusi. Materi teks asli dari tiap sumber tetap mengikuti lisensi aslinya masing-masing.