KVKK-RAG, Kişisel Verilerin Korunması Kanunu ile ilgili sorulara kaynak göstererek yanıt veren Türkçe bir RAG (Retrieval-Augmented Generation) asistanıdır. 373 resmî doküman üzerinde çalışır; hibrit arama ve cross-encoder yeniden sıralama ile arama kalitesini ölçülebilir biçimde artırır.
Sorun ve yaklaşım
KVKK mevzuatı, kurul kararları ve rehberler dağınık dokümanlarda duruyor; anahtar kelime araması çoğu zaman doğru maddeye ulaştırmıyor. Proje, bu dokümanları parçalayıp indeksleyen, ilgili parçaları getiren ve yanıtı kaynaklarıyla üreten bir RAG hattı kurar.
Hibrit arama ve cross-encoder reranking
Aday parçalar hibrit arama (anahtar kelime + vektör) ile getirilir, ardından cross-encoder modeli adayları sorguyla birlikte değerlendirip yeniden sıralar. Böylece anlamsal olarak yakın ama alakasız parçalar elenir.
Ölçüm: 27 deney, MRR +%73
Elle hazırlanmış bir altın veri setiyle 27 deneysel konfigürasyon karşılaştırıldı. En iyi yapılandırmada MRR (Mean Reciprocal Rank) 0,380'den 0,657'ye, yani %73 yükseldi. Her değişiklik sezgiyle değil ölçümle seçildi.
API ve çalıştırma
Sistem FastAPI ve GraphQL API sunar; doküman üretimi ve web arayüzü içerir. GPU destekli Docker konteynerlerinde çalışır.
Teknolojiler
- Python
- FastAPI
- GraphQL
- Docker
- RAG
- Cross-encoder
- Hibrit Arama