TÜBİTAK’ın Türkçe Büyük Dil Temel Modeli çalışmaları kapsamında farklı mimarilerle modeller geliştirilirken, 2025 sonunda paylaşılan bilgilere göre en büyük model 300 milyar Türkçe token ile eğitildi.
Token, yapay zekâ modellerinin metinleri işlerken kullandığı temel veri birimlerinden biri. Dolayısıyla söz konusu büyüklük, Türkçe içeriğin yalnızca toplanmasının değil, yapay zekânın işleyebileceği veri kümelerine dönüştürülmesinin de önemini ortaya koyuyor.
Ancak ihtiyaç yalnızca daha fazla Türkçe metin üretmek değil. Yapay zekânın Türkiye’de gerçek bir ekonomik araç hâline gelmesi için hukuk, sağlık, finans, üretim, eğitim ve kamu gibi alanların kendine özgü terminolojisini ve iş süreçlerini anlayabilmesi gerekiyor.
Sektörel Veri Yeni Yarış Alanı Olacak
Sanayi ve Teknoloji Bakanlığı da bu ihtiyaca yönelik olarak 2025 yılında Türkçe Büyük Dil Temel Modeli Sektörel Uyarlama Projesi çağrısını açtı. Proje başına 50 milyon liraya kadar destek öngörülen programla büyük dil modellerinin sektörlere özgü verilerle uyarlanması hedeflendi.
Buradaki kritik değişim, Türkiye’nin yalnızca Türkçe konuşabilen modeller üretmeye değil, Türkiye’nin ekonomik ve kurumsal yapısını anlayabilen modeller geliştirmeye yönelmesi.
Finans sektörünün diliyle sağlık sektörünün dili aynı değil. Bir üretim tesisindeki teknik veriler, kamu kurumlarının mevzuat diliyle örtüşmüyor. Bu nedenle önümüzdeki dönemde yapay zekâ rekabetinin önemli bir bölümü model büyüklüğünden çok, hangi veriye erişilebildiği ve bu verinin ne kadar kaliteli olduğu üzerinden şekillenecek.
Türkiye açısından stratejik konu, yalnızca büyük bir Türkçe veri havuzu oluşturmakla sınırlı kalmayacak. Asıl hedef, bu verileri ekonomik değere dönüştürebilecek nitelikli ve sektörel bir veri ekosistemi kurabilmek olacak.




