Menyiapkan halaman...

MEA Ecosystem · Dataset Terbuka

Pustaka

Korpus teks terbuka berskala besar untuk melatih model bahasa — mencakup web, kode, matematika, instruksi, hukum, dan Wikipedia dalam lima bahasa.

idPerpustakaan terbuka untuk siapa saja.
enAn open library for everyone.
ja誰にでも開かれた図書館。
ko모두를 위한 열린 도서관.
zh面向所有人的开放图书馆。

Skala

Diukur, bukan diperkirakan

Setiap angka di sini dihitung langsung dari corpus menggunakan tokenizer Pustaka sendiri — dapat direproduksi oleh siapa saja.

~20,15B Token (estimasi)
~31,5 Jt Dokumen
5 Bahasa
131.072 Vocab Tokenizer

Struktur

Apa saja isinya

Tujuh kategori corpus, dikurasi dan dibersihkan dengan pipeline yang sama.

Corpus Bahasa Keterangan
corpus-bahasa-indonesia id CulturaX, Indo4B, CC-News, Wikipedia, Kaskus WebText
corpus-bahasa-indonesia-native id Common Crawl langsung — lisensi bersih tanpa batasan non-komersial
corpus-code 10 bahasa pemrograman, lisensi permissive saja
corpus-math en GSM8K, NuminaMath-CoT
corpus-instruct id, en Dolly-15k, Alpaca-cleaned-Indonesian, OIG
corpus-hukum ja, en Perundang-undangan Jepang dan Amerika Serikat
wikipedia ja, ko, zh Wikipedia multi-bahasa di luar Bahasa Indonesia

Lisensi

Bebas dipakai, termasuk komersial

Hasil kurasi Pustaka dirilis di bawah MEA Ecosystem Open License (MEA-OL) — bebas digunakan untuk keperluan apa pun dengan syarat atribusi. Materi teks asli dari tiap sumber tetap mengikuti lisensi aslinya masing-masing.

Baca rincian lisensi lengkap