Konu zekâsı2026
ContextLens
Sohbetin neyle ilgili olduğunu izler — emin değilse tahmin yerine “uncertain” der.
Açık kaynak · Apache-2.0 · model v1.1.0

Kanıtlar
- kilitli Wikipedia holdout'unda macro-F1
- 0,838
- reports/
locked/ results.json - medyan sınıflandırma gecikmesi, 4 vCPU, GPU yok
- 19,9 ms
- reports/
locked/ results.json - asistan sohbetinde konu dışı AUROC
- 0,961
- reports/
locked/ results.json - diskteki modelin tamamı, kodlayıcı dahil
- 47 MB
- README.md
Her sayı depodaki bir dosyadan geliyor — yolu hemen altında.
Problem
Softmax sınıflandırıcı her zaman bir konu döndürür: “I'm going to order pizza tonight” cümlesine ContextLens'in altındaki model de %53,0 ile Books der. Sohbette bu, susmaktan kötüdür; başıboş bir etiket temayı yönlendirir. Üstelik yalnızca ansiklopedi metnine bakılarak seçilen bir model sıralamada birinci olup insanların gerçekten yazdığı kısa sorularda yine de tökezleyebilir.
Yaklaşım
İncelenen dokuz veri setinden hiçbiri 8 × 28'lik taksonomiyi kapsamadığından İngilizce Wikipedia'dan 40.112 pasajlık bir derlem kuruldu; etiketler Wikipedia'nın kendi kategori grafiğinden geliyor. İnce ayarlı bir MiniLM kodlayıcı, 28 alt konu üzerinde sıcaklık ölçeklemeli tek bir softmax'ı besler; Mahalanobis mesafe kapısı, %50'lik güven eşiği ve fastText dil kapısı da yanıtın ne zaman “uncertain” ya da “not English” olacağını belirler. Temayı yalnızca güvenle sınıflanan mesajlar besler: tema sönümlenir, dört tur boyunca güvenilir bir konu gelmezse sıfırlanır ve baskın konusu birbirini doğrulayan iki mesajla değişir; bunun bedeli, gerçek bir konu değişiminin yaklaşık 0,6 tur gecikmeyle izlenmesidir. Tüm seçimler, gerçek Stack Exchange soruları da dahil olmak üzere geliştirme verisiyle yapıldı; nihai skorlar, yapılandırmanın parmak izi alındıktan sonra puanlanan kilitli bir holdout'tan geliyor.
Neler hazır
- Konu dışı asistan sohbetinin %78,1'ine konu atamaz, İngilizce olmayan cümlelerin %96,7'sini ayırt eder
- Gerçek sorularla da seçildi: mpnet-base Wikipedia'da başa baş ama 4,9 kat daha yavaş ve sorularda daha zayıf
- Kilitli holdout SHA-256 dondurmasından sonra puanlandı; iki kez koşması gerekti, iki koşu da gerekçesiyle açık
- Simüle sohbetlerde tek mesajlık bir sapma temayı artık %48,8 yerine %10,4 oranında ele geçiriyor
Mimari

README demosunun gerçek CLI çıktısı: roman, bilimsel yöntem ve evrim ayrı ayrı konu, alt konu ve güven alır; üçü, aramayı da besleyen tek temada birleşir: “science books about biology”.
Diğer 2026 ürünleri
- Yapay zekâ kod yönetişimiMembrane AIYapay zekânın kodunda bulduğu sırları maskeler, merge'ü kapıda tutar; model şart değil.
- İlişkisel MLRealPathTahmin sorularına ilişkili tablolardan yanıt verir — sızıntıya karşı sınanmış, açıklamalı.
- Ajan güvencesiAgentTwin200 OK yanıtının gizlediği ajan regresyonlarını, başladıkları adıma kadar yakalar.
- Mobil · Yapay zekâUniversal AI AstroYapay zekânın gerçek efemeris verisini yorumladığı, uydurmadığı bir astroloji uygulaması.



