DOĞRULUK VE METODOLOJİ

Doğruluğu iddia etmiyoruz, ölçüyoruz.

Üretilen bir sorgu 'çalıştı' diye doğru sayılmaz. Testlerimiz sorgunun döndürdüğü veriyi referans cevapla karşılaştırır — hatasız çalışan ama yanlış cevap veren sorgu, başarısız sayılır.

638/661

%97

Sonuç doğruluğu — tam altın set

Dört veritabanı motorunda (PostgreSQL, SQL Server, MySQL, Oracle) 661 gerçek soru, ürünün kendi kod yolundan koşuldu (3 Eylül 2026). Skor, SQL metni benzerliği değil, dönen verinin referans cevapla eşleşme oranıdır: sorgu hatasız çalışsa bile veri yanlışsa başarısız sayılır. Set, bilerek kriptik eski sistem şemalarını da içerir.

Tek sayı yerine dağılım

Tek bir toplam oran bir iddiadır; dağılım kanıttır. Aynı koşumun kesitleri aşağıda. Paydaları da veriyoruz, çünkü küçük örneklemde çıkan yüksek oran az şey söyler.

Doğruluk kesitleri: veritabanı motoruna, soru türüne ve şema tipine göre doğru cevaplanan soru sayısı.
KesitDoğru / soru
VERİTABANI MOTORUNA GÖRE
PostgreSQL22/22
SQL Server92/93
MySQL266/276
Oracle258/270
SORU TÜRÜNE GÖRE
Tek adımlı sorular187/188
Çok adımlı analitik sorular451/473
ŞEMA TİPİNE GÖRE
Anlamlı adlandırılmış şema506/528
Kriptik şema, açıklama katmanı devrede132/133

İki not. Şema tipi satırındaki kriptik setler, açıklama katmanı devredeyken ölçülür; yani buradaki sonuç “kriptik şema daha kolay” demek değil, “açıklama katmanı farkı kapatıyor” demektir. Açıklama girilmemiş kriptik bir şemada oran düşer. İkincisi, PostgreSQL kesitinin paydası küçük (22 soru); o satırı diğerleriyle aynı ağırlıkta okumayın.

Nasıl ölçüyoruz?

Farklı iş alanlarından (satış, sağlık, üretim, eski nesil ERP) gerçekçi şemalar üzerinde yüzlerce Türkçe soru içeren bir test seti kullanıyoruz; dört veritabanı motorunda koşuyoruz. Setin bir bölümü bilerek kriptik, kodlu kolonlarla dolu 'kötü' şemalardan oluşur, çünkü gerçek dünya böyle. O şemalar açıklama katmanı devredeyken ölçülür: ölçtüğümüz şey, bir operatörün kolon anlamlarını girdiği bir kurulumdur.

  1. 01Her soru için PerSight'ın üretim hattı bir SQL sorgusu üretir — test için özel bir kestirme yolu yoktur.
  2. 02Üretilen sorgu ve elle yazılmış referans sorgu, canlı test veritabanında ayrı ayrı çalıştırılır.
  3. 03İki sonucun döndürdüğü veri karşılaştırılır: satırlar ve değerler eşleşiyorsa soru geçer. Çalışan ama yanlış cevap veren sorgu başarısız sayılır.
  4. 04Bilerek cevaplanamaz sorular da sete dahildir: model uydurma bir sorgu üretmek yerine dürüstçe 'cevaplayamam' demelidir — uydurursa soru başarısız sayılır.

Yanlış sonuç problemine dört katman

Doğal dille sorgu araçlarının en sinsi hatası, hatasız çalışıp yanlış cevap döndüren sorgudur. Ana kaynağı dil anlama değil, şemanın yanlış yorumlanmasıdır. PerSight bu probleme dört katmanla yaklaşır:

Şema açıklama katmanı

Kriptik kolonlar ve kodlu değerler (ör. 1=Müşteri, 2=Tedarikçi) taranır, size önerilir, onayınızla modele öğretilir. Eski nesil şemalarda doğruluğun ana taşıyıcısı budur.

İlişki disiplini

Tablolar yalnızca şemada tanımlı ilişkiler üzerinden birleştirilir; isim benzerliğine dayalı tahmini birleştirmeler kurallarla engellenir.

Kendini onaran sorgu

Çalışma anında hata veren sorgu, hata mesajıyla birlikte modele geri götürülür ve bir kez onarılır — çoğu geçici hata kullanıcıya hiç yansımaz.

Dürüst red

Soru, şemanızdaki verilerle cevaplanamıyorsa PerSight makul görünen bir sorgu uydurmak yerine neyin eksik olduğunu söyler. Yanlış cevaptan iyisi, dürüst bir 'cevaplayamam'dır.

Dürüst bir not

Bu skor kendi test setimizde ölçülmüştür; bağımsız bir kıyaslama değildir. Gerçek doğruluk şemanızın kalitesine ve açıklama katmanını kullanımınıza göre değişir. Kendi ölçümümüzde zorluk farkı artık şemanın temizliğinden çok sorunun karmaşıklığından geliyor: çok adımlı analitik sorular, tek adımlı sorulardan belirgin biçimde daha zor. Metodolojiyi ve test setini incelemek isteyen kurumsal ekiplerle memnuniyetle paylaşırız.

Sık sorulanlar

Yüzde 97 tam olarak ne anlama geliyor?

Üretilen sorguların yüzde 97 kadarı, referans cevapla birebir aynı veriyi döndürdü. Ölçüt sonuç eşleşmesidir: sorgu hatasız çalışsa bile veri yanlışsa soru başarısız sayılır.

Neden yüzde 100 değil?

Kalan sorular çoğunlukla en karmaşık analitik senaryolarda ve bilerek kriptik bıraktığımız şemalarda düşüyor. Ölçütümüz sert: çalışan ama yanlış veri döndüren her sorgu başarısızdır. Skoru şişirmek yerine seti zorlaştırarak ilerlemeyi ölçüyoruz.

Benim şemamda da bu oran tutar mı?

Şemanızın kalitesine bağlıdır. Açıklayıcı tablo ve kolon adları olan şemalarda oran test skorumuzun üzerine çıkabilir; kriptik şemalarda açıklama katmanını onayladıkça belirgin şekilde artar. Testte her iki tip şemayı da ölçüyoruz.

Yanlış bir sonucu nasıl fark ederim?

Üretilen SQL her zaman ekranda görünür ve Türkçe açıklanır; çalıştırmadan önce düzenleyip onaylayabilirsiniz. Soru şemanızla cevaplanamıyorsa PerSight sorgu uydurmak yerine bunu açıkça söyler. Tüm sorgular salt-okunurdur — yanlış bir sorgu bile verinize dokunamaz.

Kendi verinizde deneyin

En iyi test sizin şemanız. Ücretsiz hesap açın, ilk sorunuzu kendi veritabanınızda sorun.