> Dataset pelatihan untuk model AI KiKai > Developer: Idin Iskandar > Bahasa utama: Indonesia (sebagian bilingual ID/EN) > Format: JSONL chat messages (kompatibel OpenAI / HuggingFace SFT)
Fonte do modelo
Descrição da fonte
Dataset pelatihan untuk model AI KiKai
Developer: Idin Iskandar
Bahasa utama: Indonesia (sebagian bilingual ID/EN)
Format: JSONL chat messages (kompatibel OpenAI / HuggingFace SFT)
Fontes
1 fonteVerificado 14 de set.
Artefatos de modelo
1 artefatoTrechos de fonte
2 trechosDataset ini adalah kumpulan >4.600 pasangan tanya-jawab dan bacaan referensi berbahasa Indonesia yang dirancang untuk melatih model bahasa (LLM) agar:
Semua file .jsonl memakai skema chat messages — satu baris = satu contoh percakapan:
{"messages": [
{"role": "user", "content": "Ibu kota Jepang?"},
{"role": "assistant", "content": "Tokyo."}
]}
File .md berisi bacaan naratif (topik pengetahuan) yang bisa dipakai sebagai corpus continued pre-training atau retrieval context (RAG).
dataset-universal/
├── README.md ← file ini
│
├── identity/ ← identitas & persona KiKai
│ ├── universal_persona.jsonl
│ └── kikai_developer.jsonl (NEW)
│
├── interaction/ ← percakapan sehari-hari
│ ├── casual_chat.jsonl
│ ├── casual_chat_lanjut.jsonl (NEW)
│ ├── emotional_support.jsonl (NEW — dukungan emosional + small talk)
│ └── batas_pengetahuan.jsonl (NEW — anti-halusinasi)
│
└── knowledge/ ← pengetahuan tematik
│
├── agama/
│ ├── agama_di_indonesia.md
│ └── qa_agama.jsonl
│
├── astronomi/
│ ├── astronomi_populer.md
│ └── qa_astronomi.jsonl
│
├── bahasa/
│ ├── bahasa_indonesia.md
│ ├── qa_bahasa.jsonl
│ ├── qa_kosakata_en_id.jsonl
│ ├── qa_kalimat_id_en.jsonl (NEW — 100 kalimat bilingual)
│ ├── qa_kata_kerja_en_id.jsonl (NEW — 88 kata kerja)
│ └── qa_angka_ke_kata.jsonl (NEW — angka 0-100)
│
├── budaya/
│ └── budaya_indonesia.md
│
├── ekonomi/
│ ├── dasar_ekonomi.md
│ └── qa_ekonomi.jsonl
│
├── filsafat/
│ └── qa_filsafat.jsonl
│
├── geografi/
│ ├── geografi_dunia.md
│ ├── qa_geografi.jsonl
│ ├── qa_ibukota_dunia.jsonl
│ ├── qa_provinsi_indonesia.jsonl
│ ├── qa_provinsi_indonesia_lengkap.jsonl (NEW — 38 provinsi)
│ └── qa_negara_detail.jsonl (NEW — mata uang/bahasa/benua)
│
├── hewan/
│ ├── dunia_hewan.md
│ ├── qa_hewan.jsonl
│ ├── qa_hewan_detail.jsonl
│ └── qa_hewan_lengkap.jsonl (NEW — habitat, kelas, ciri)
│
├── kuliner/
│ ├── kuliner_indonesia_dunia.md
│ └── qa_kuliner.jsonl
│
├── lingkungan/
│ ├── perubahan_iklim.md
│ └── qa_lingkungan.jsonl
│
├── matematika/
│ ├── kalkulus_aljabar.md
│ ├── qa_matematika_dasar.jsonl
│ ├── qa_matematika_tambahan.jsonl (NEW — 858 soal + konsep)
│ ├── qa_tabel_perkalian.jsonl (NEW — tabel 1-12)
│ └── qa_angka_romawi.jsonl (NEW)
│
├── olahraga/
│ ├── olahraga_dunia.md
│ └── qa_olahraga.jsonl
│
├── psikologi/
│ ├── pengantar_psikologi.md
│ └── qa_psikologi.jsonl
│
├── purba/
│ ├── dinosaurus_prasejarah.md
│ └── qa_purba.jsonl
│
├── sains_medis/
│ ├── fisika_dasar_kuantum.md
│ ├── kedokteran_anatomi.md
│ ├── qa_sains.jsonl
│ ├── qa_unsur_kimia.jsonl
│ └── qa_sains_umum.jsonl (NEW — fisika/kimia/biologi)
│
├── sejarah/
│ ├── sejarah_dunia.md
│ ├── sejarah_indonesia.md
│ ├── qa_sejarah_dunia.jsonl
│ ├── qa_sejarah_indonesia.jsonl
│ ├── qa_presiden_ri.jsonl
│ └── qa_sejarah_tambahan.jsonl (NEW — tokoh & peristiwa)
│
├── seni/
│ ├── seni_budaya.md
│ └── qa_seni.jsonl
│
├── teknologi/
│ ├── teknologi_dan_komputer.md
│ ├── qa_teknologi.jsonl
│ ├── qa_pemrograman.jsonl
│ └── qa_pemrograman_lanjut.jsonl (NEW — konsep + snippet kode)
│
├── tokoh/ (NEW)
│ └── qa_tokoh_dunia.jsonl (25 tokoh dunia)
│
└── umum/ (NEW)
├── qa_kalender_waktu.jsonl
├── qa_dasar_visual.jsonl (warna, bentuk, arah)
├── qa_konversi_satuan.jsonl
└── qa_tips_praktis.jsonl
| Kategori | Total Entri |
|---|---|
| Matematika | ~1.100 |
| Bahasa & translasi | ~1.160 |
| Geografi | ~630 |
| Hewan | ~270 |
| Sejarah | ~130 |
| Sains & medis | ~100 |
| Teknologi/coding | ~90 |
| Interaction/chat | ~115 |
| Identity | ~75 |
| Lain-lain | ~950 |
| TOTAL JSONL | ~4.600+ |
Plus ~20 file markdown sebagai bacaan referensi.
import json, glob
data = []
for fp in glob.glob("dataset-universal/**/*.jsonl", recursive=True):
with open(fp, encoding="utf-8") as f:
for line in f:
data.append(json.loads(line))
print(f"Total contoh: {len(data)}")
print(data[0])
datasetsfrom datasets import load_dataset
ds = load_dataset("json", data_files="dataset-universal/**/*.jsonl", split="train")
Format messages sudah kompatibel dengan:
chat_template: chatml)apply_chat_template)Sepanjang dataset, model secara konsisten menyebut dirinya:
Ditambahkan ~1.460 entri baru di 4 kategori besar:
knowledge/hukum/ — hukum umum, KUHP/KUHPerdata, pasal populer UUD 1945, ketenagakerjaan, pajak, situasi praktis, istilah hukum. (~220 entri)knowledge/kedokteran/ — penyakit umum, obat, anatomi, PPPK, gejala→diagnosis. (~210 entri)interaction/dialog_multi_turn*.jsonl — dialog 3–6 giliran: konsultasi, medis, hukum, teknis, chit-chat. (~105 dialog)knowledge/reasoning/ — Chain-of-Thought: soal cerita matematika, common sense, logika, sains-reasoning. (~925 entri)Semua jawaban medis & hukum diberi disclaimer edukasi otomatis di akhir teks.
--- model: KiKai 7B library_name: peft pipeline_tag: text-generation tags: - KiKai - lora - sft - transformers - trl --- # Dataset Universal — KiKai > Dataset pelatihan untuk model AI **KiKai** > Developer: **Idin Iskandar** > Bahasa utama: **Indonesia** (sebagian bilingual ID/EN) > Format: **JSONL chat messages** (kompatibel OpenAI / HuggingFace SFT) --- ## Tentang Dataset Dataset ini adalah kumpulan **>4.600 pasangan tanya-jawab** dan bacaan referensi berbahasa Indonesia yang dirancang untuk melatih model bahasa (LLM) agar: - Menjawab pertanyaan **pengetahuan umum** (sains, sejarah, geografi, budaya, hewan, kuliner, dst.) - Melakukan **percakapan santai** yang natural dan empatik - Memiliki **identitas konsisten** sebagai **KiKai** — asisten AI karya **Idin Iskandar** - Melakukan **terjemahan** Indonesia ↔ Inggris (kosakata & kalimat) - Menghitung **matematika dasar** (aritmatika, perkalian, persen, geometri, romawi) - Membantu di ranah **coding & teknologi** - Menyadari **batas pengetahuannya** (anti-halusinasi dasar) --- ## Format Data Semua file `.jsonl` memakai skema **chat messages** — satu baris = satu contoh percakapan: ```json {"messages": [ {"role": "user", "content": "Ibu kota Jepang?"}, {"role": "assistant", "content": "Tokyo."} ]} ``` File `.md` berisi bacaan naratif (topik pengetahuan) yang bisa dipakai sebagai **corpus continued pre-training** atau **retrieval context (RAG)**. --- ## Struktur Direktori ``` dataset-universal/ ├── README.md ← file ini │ ├── identity/ ← identitas & persona KiKai │ ├── universal_persona.jsonl │ └── kikai_developer.jsonl (NEW) │ ├── interaction/ ← percakapan sehari-hari │ ├── casual_chat.jsonl │ ├── casual_chat_lanjut.jsonl (NEW) │ ├── emotional_support.jsonl (NEW — dukungan emosional + small talk) │ └── batas_pengetahuan.jsonl (NEW — anti-halusinasi) │ └── knowledge/ ← pengetahuan tematik │ ├── agama/ │ ├── agama_di_indonesia.md │ └── qa_agama.jsonl │ ├── astronomi/ │ ├── astronomi_populer.md │ └── qa_astronomi.jsonl │ ├── bahasa/ │ ├── bahasa_indonesia.md │ ├── qa_bahasa.jsonl │ ├── qa_kosakata_en_id.jsonl │ ├── qa_kalimat_id_en.jsonl (NEW — 100 kalimat bilingual) │ ├── qa_kata_kerja_en_id.jsonl (NEW — 88 kata kerja) │ └── qa_angka_ke_kata.jsonl (NEW — angka 0-100) │ ├── budaya/ │ └── budaya_indonesia.md │ ├── ekonomi/ │ ├── dasar_ekonomi.md │ └── qa_ekonomi.jsonl │ ├─...
Source context: 6 downloads · 0 likes · Pipeline text-generation · Library peft · Repo IDINN/KiKai-Universal-7B