Blog'a dön
Yapay Zeka6 dk okuma5 Haziran 2026

RAG Sistemi Nedir? Şirket Belgelerinizi Yapay Zekaya Öğretin

RAG (Retrieval-Augmented Generation) nedir, şirket belgelerinizle çalışan kaynak gösteren bir yapay zekâ nasıl kurulur? Doküman işleme, parçalama, vektör arama, hibrit arama, yeniden sıralama, yetki kontrolü, güvenlik ve başarı ölçümü için rehber.

RAG Sistemi Nedir? Şirket Belgelerinizi Yapay Zekaya Öğretin

Kısaca: RAG (Retrieval-Augmented Generation — bilgi getirmeyle güçlendirilmiş üretim), bir yapay zekâ modelinin cevap vermeden önce şirketinizin kendi belgelerinden ilgili bölümleri bulup bunlara dayanarak yanıt yazmasıdır. Model yeniden eğitilmez; bilgi, sorgu anında dışarıdan getirilir. Bu sayede cevaplar güncel, kaynak gösteren ve şirkete özgü olur; uydurma (halüsinasyon) riski azalır ama sıfırlanmaz. Kurumsal RAG'in başarısı modelden çok doküman kalitesi, arama kalitesi, yetki kontrolü ve ölçüm ile belirlenir.

Son güncelleme: Eylül 2026

RAG nedir ve neden ihtiyaç var?

Büyük dil modelleri (LLM) genel bilgiyle eğitilmiştir; sizin ürün kataloğunuzu, iç politikalarınızı, sözleşmelerinizi veya teknik dokümanlarınızı bilmez ve eğitim tarihinden sonraki gelişmelerden habersizdir. İki sorun çıkar: bilgi eksikliği ve uydurma cevap. RAG, konuya özgü belgeleri model cevap yazmadan önce bağlam olarak sunarak bu iki sorunu azaltır. Yaklaşım, 2020'de yayımlanan ve bilgi getirmeyi üretimle birleştiren “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks” makalesiyle yaygınlaştı.

RAG mı, ince ayar (fine-tuning) mı?

  • RAG: Sık değişen, kaynak gösterilmesi gereken, belge bazlı bilgi için uygundur (politikalar, ürün dokümanları, sözleşmeler, SSS). Belgeler güncellendiğinde model değil, indeks güncellenir.
  • İnce ayar: Modelin tarzını, formatını veya davranışını ayarlamak içindir; bilgi ezberletmek için güvenilir bir yol değildir.
  • Çoğu kurumsal senaryoda önce RAG denenir; gerekirse ikisi birlikte kullanılır.

RAG mimarisi: adım adım

1. Doküman toplama ve işleme

PDF, Word, Excel, e-posta, wiki, ticket geçmişi ve veritabanı kayıtları toplanır. PDF'lerde tablo, başlık yapısı ve taranmış (görüntü) sayfalar için OCR gerekir; kötü ayrıştırılmış doküman, en iyi modeli bile yanıltır. Bu aşamada metinle birlikte kaynak bilgisi (dosya, sayfa, bölüm, tarih, versiyon, yetki) meta veri olarak saklanır.

2. Parçalama (chunking)

Belgeler anlamlı parçalara bölünür. Parça boyutu, sınırları ve çakışması arama kalitesini doğrudan etkiler: çok küçük parçalar bağlamı kaybeder, çok büyükler alakasız içerik getirir. Başlık ve bölüm yapısına göre bölmek, sabit karakter sayısına göre bölmekten genellikle daha iyidir.

3. Gömme (embedding) ve indeksleme

Her parça, anlamı temsil eden bir sayısal vektöre çevrilir ve vektör veritabanında (ör. PostgreSQL + pgvector veya özel vektör servisleri) saklanır. Türkçe içerik için modelin Türkçe performansını mutlaka test edin.

4. Getirme (retrieval): hibrit arama ve yeniden sıralama

Kullanıcı sorusu da vektöre çevrilip en yakın parçalar bulunur. Ancak yalnızca vektör arama, ürün kodu veya madde numarası gibi tam eşleşme gerektiren sorularda zayıf kalabilir. Bu yüzden hibrit arama (vektör + BM25 gibi anahtar kelime tabanlı arama) ve ardından bir yeniden sıralama (reranking) aşaması yaygındır.

Anthropic'in yayımladığı Contextual Retrieval yöntemi, her parçaya, gömmeden önce belgedeki yerini açıklayan kısa bir bağlam ekliyor; raporlanan sonuçlarda başarısız getirme oranı bağlamsal gömme ile %35, bağlamsal BM25 ile birlikte %49, yeniden sıralama eklenince %67 azaldı (5,7%'den 1,9%'a). Bu, kendi verinizle geçerli olacak bir garanti değil; ama arama katmanının cevap kalitesi üzerindeki etkisini gösteriyor.

5. Üretim: kaynak gösteren cevap

Getirilen parçalar, kullanıcı sorusuyla birlikte modele verilir. Model yalnızca bu kaynaklara dayanarak cevap yazmalı, kaynağı (belge, sayfa, bölüm) göstermeli ve kaynaklarda bilgi yoksa “bu konuda belgelerde bilgi bulamadım” demelidir. Bu davranış, sistem talimatında açıkça tanımlanır ve test edilir.

6. Değerlendirme ve izleme

RAG'in kalitesi ölçülmeden iyileşmez; aşağıya bakın.

Kurumsal RAG'in kritik konuları

Yetki kontrolü (doküman bazlı erişim)

En sık atlanan konu: her kullanıcı her belgeye erişemez. İK belgeleri, sözleşmeler veya finansal raporlar için erişim yetkisi getirme aşamasında uygulanmalı; yetkisiz belge, modele hiç verilmemelidir. Aksi hâlde sistem, yetkisiz kişiye bilgi sızdırabilir.

Güvenlik: OWASP LLM Top 10

OWASP'ın LLM uygulamaları için 2025 Top 10 listesi RAG sistemleri için doğrudan geçerli:

  • Prompt Injection: Kullanıcı girdisinde veya indekslenen belgenin içinde gizlenmiş talimatlar modeli yönlendirebilir. Belge içeriğini “talimat” değil “veri” olarak ele alın.
  • Sensitive Information Disclosure: Hassas bilginin cevaplara sızması.
  • Vector and Embedding Weaknesses: Vektör deposuna erişim ve veri izolasyonu açıkları.
  • Excessive Agency: Modelin fazla yetkiyle işlem yapması (silme, e-posta gönderme vb.). Yetkiyi asgariye indirin.
  • Misinformation: Yanlış veya uydurma içerik.
  • Unbounded Consumption: Kontrolsüz kullanım ve maliyet; istek sınırı ve bütçe uyarıları koyun.

KVKK ve veri konumu

Belgeler kişisel veri içeriyorsa aydınlatma, veri minimizasyonu ve saklama süreleri geçerlidir; verilerin hangi model sağlayıcısına ve hangi ülkeye gittiği bilinmeli. KVKK'nın üretken yapay zekâ rehberi çıktıların her zaman doğru olmayabileceğini ve insan denetiminin önemini vurgular. Gerekirse hassas alanları maskeleyin veya belge bazında dışarıda bırakın.

Güncellik ve versiyon yönetimi

Belge güncellendiğinde indeks otomatik yenilenmeli, eski versiyonlar arşivlenmeli ve cevaplarda belge tarihi görünmelidir. Eski politikadan cevap veren bot, hiç cevap vermeyen bottan daha zararlıdır.

Başarıyı ölçmek

Bir “altın soru seti” (gerçek kullanıcı sorularından 50–200 örnek ve beklenen kaynak/cevap) hazırlayın ve şunları izleyin:

  • Getirme başarısı: Doğru kaynak, ilk N sonuç arasında mı?
  • Sadakat (faithfulness): Cevap, getirilen kaynaklarla uyumlu mu, uydurma yok mu?
  • Cevap alaka düzeyi: Kullanıcının sorusunu gerçekten cevaplıyor mu?
  • Kaynak gösterimi doğruluğu.
  • “Bilmiyorum” davranışı: Kaynak yoksa uydurmak yerine reddediyor mu?
  • Kullanıcı geri bildirimi (beğen/beğenme) ve insan devri oranı.

Her değişiklikte (parçalama, model, prompt) bu set yeniden çalıştırılmalıdır.

Tipik kullanım senaryoları

  • Müşteri destek asistanı: Ürün dokümanı ve SSS'ye dayalı cevap; bilinmeyen sorularda insana devir (AI Müşteri Destek Asistanı).
  • İç bilgi asistanı: İK politikaları, prosedürler, onboarding.
  • Sözleşme ve doküman analizi: Maddeleri bulma, karşılaştırma, özetleme.
  • Teknik doküman arama: Mühendislik ve saha ekipleri için.
  • Chatbot bilgi tabanı: Web ve WhatsApp botları için (chatbot rehberi, WhatsApp rehberi).

RAG ne zaman yeterli olmaz?

  • Yapılandırılmış veri sorguları (bu ay kaç sipariş var? stok kaç?) için veritabanı sorgusu/araç çağrısı daha doğrudur.
  • Karmaşık hesaplama ve kural motoru gerektiren işler için modelin tahmini yerine kod kullanın.
  • Dağınık, güncel olmayan belge yığını varsa önce içerik yönetimini düzeltin: “çöp içeri, çöp dışarı.”

Aktaş Digital ne sağlıyor?

AI Doküman Analiz & RAG Sistemleri hizmetimizde PDF/Word ayrıştırma, vektör ve hibrit arama, kaynak atıflı yanıt ve yetki kontrolü ile kurumsal RAG çözümleri geliştiriyoruz. Önce belge ve kullanım senaryonuzu birlikte netleştirir, kalite ölçümünü sistemin parçası yaparız. Teklif formundan ihtiyacınızı paylaşabilirsiniz.

Sık Sorulan Sorular

RAG halüsinasyonu tamamen önler mi?

Hayır; azaltır. Kaynaklara dayanmayı zorunlu kılmak, kaynak göstermek ve “bilmiyorum” davranışını test etmek riski düşürür; kritik alanlarda insan denetimi yine gerekir.

RAG için hangi belge türleri uygun?

PDF, Word, sunum, wiki sayfası, SSS, ticket geçmişi, ürün kataloğu. Kaliteli, güncel ve iyi yapılandırılmış belgelerde sonuç daha iyidir.

Veriler yapay zekâ sağlayıcısına gidiyor mu?

Mimariye bağlı: model API'si kullanılıyorsa sorgu ve getirilen parçalar sağlayıcıya iletilir; bu, KVKK ve sözleşme açısından değerlendirilmelidir. Gizlilik gereksinimi yüksekse kendi altyapınızda çalışan bir model seçeneği düşünülebilir.

RAG kurulumu ne kadar sürer?

Bir pilot (sınırlı belge kümesi, tek senaryo) haftalar içinde çalışabilir; belge temizliği, yetkilendirme, ölçüm ve entegrasyon süreyi belirler.

Türkçe belgelerde RAG çalışır mı?

Evet; ancak gömme modelinin ve arama katmanının Türkçe performansı gerçek belgelerle test edilmelidir.

Sonuç

RAG, yapay zekâyı şirketinizin bilgisine bağlayan en pratik yöntemdir. Doğru belge işleme, hibrit arama, yetki kontrolü, güvenlik ve sürekli ölçümle kurulduğunda hem çalışanlar hem müşteriler için güvenilir bir bilgi asistanına dönüşür.

#Mimari#SaaS

İletişim ve bağlantılar yükleniyor…