AI'nın Yanlış Yanıtlarını Nasıl Yakalarım? 7 Sinyal + Otomatik Filtreleme (2026)
Her AI bazen yanlış yanıt verir; sorun yanlışı yakalamamak. 7 erken uyarı sinyali (sentiment kayması, halüsinasyon, fiyat sapması, marka tonu kırılması), otomatik filtreleme mimarisi, insan onay paneli ve kendi hata oranınızı ölçme yöntemi.
AI'nın Yanlış Yanıtlarını Nasıl Yakalarım? 7 Sinyal + Otomatik Filtreleme (2026)
TL;DR: AI'lar mükemmel değil; hangi modeli kullanırsanız kullanın bir kısım yanıt hatalı çıkıyor — fiyat hatası, ton kırılması, marka dışı içerik, yasal sınır aşımı veya halüsinasyon. Hata oranına dair sayı vermiyoruz: oran modele, bilgi tabanınızın kalitesine ve müşteri sorularının tipine göre değişiyor, kendi hesabınızda ölçmeniz gerekiyor. Bu yazıda yanlış yanıtı göndermeden yakalamak için 7 erken uyarı sinyali, otomatik filtreleme katmanları, hibrit insan onay paneli ve kendi hata oranınızı ölçme yöntemi var.
30 saniyede ne öğreneceksin?
| Soru | Cevap |
|---|---|
| AI yanıt kalitesi nasıl ölçülür? | 4 boyutta puanlayarak: doğruluk (fiyat/stok), ton uyumu, marka kurallarına uyum, yasal sınır. Hedefi kendi tabanınıza göre siz belirlersiniz. |
| Yanlış yanıt yakalamanın temel mantığı nedir? | Üretim sonrası otomatik filtreleme → kuralları geçemeyen yanıt insan onayına gider. |
| 7 erken uyarı sinyali nedir? | (1) sentiment kayması, (2) halüsinasyon, (3) fiyat sapması, (4) marka tonu kırılması, (5) yasak kelime, (6) çok uzun/kısa yanıt, (7) müşteri belirsizliği. |
| Hibrit modda insan onayı oranı ne olmalı? | Yanlış yanıtın size maliyeti ne kadar yüksekse o kadar yüksek. Sağlık ve finans gibi alanlarda belirgin şekilde artırılmalı (aşağıda ayrıntılı). |
| Kalibrasyon ritmi ne? | Haftalık az sayıda örneği elle okuyup puanlamak + aylık yanlış-pozitif/yanlış-negatif oranınızı ölçmek. |
1. AI yanlış yanıt ne kadar sık verir?
Bu soruya oran tablosuyla cevap veren kaynaklara temkinli yaklaşın — bizim de paylaşacağımız bir ölçüm yok. Sebebi şu: hata oranı kullandığınız modelden çok bilgi tabanınızın eksiksizliğine ve müşterilerinizin sorduğu soruların tipine bağlı. Fiyat listesi ve stok bilgisi güncel olan bir hesapta fiyat hatası neredeyse görülmüyor; bilgi tabanı yarım bırakılmış bir hesapta AI boşluğu doldurmaya çalıştığı için halüsinasyon oranı yükseliyor. Aynı yazılım, iki hesapta bambaşka sonuç veriyor.
Onun yerine size kendi hata oranınızı ölçmenin yöntemini verelim. İki saatlik bir iş ve bir daha kimsenin sayısına ihtiyaç duymazsınız:
Kendi hata tabanınızı kurma (2 saat)
- Örneklem alın: Son 30 günde AI'ın gönderdiği yanıtlardan rastgele 100 tanesini çekin. Rastgele olması önemli — sadece şikayet gelen konuşmalara bakarsanız tablo olduğundan kötü, sadece kolay soruları okursanız olduğundan iyi görünür.
- Her yanıtı 4 boyutta işaretleyin: doğruluk (fiyat/stok/ürün bilgisi doğru mu), ton (marka sesinize uyuyor mu), marka kuralları (söylenmemesi gerekeni söylüyor mu), yasal sınır (sektörünüzün kırmızı çizgisini aşıyor mu).
- İki ayrı oran çıkarın: kaç yanıt hatalıydı (ham hata) ve bunların kaçı müşteriye gitmeden filtreye/insan onayına takıldı (yakalanan). Sizi ilgilendiren asıl sayı ikisinin farkı: müşteriye ulaşan hata.
- Tekrarlayın: Aynı ölçümü ayda bir yapın. Tek bir ölçüm size bir fotoğraf verir; ikinci ölçüm yön verir — filtre ayarlarınız işe yarıyor mu yaramıyor mu buradan anlaşılıyor.
Neden bu ölçümü yapmadan filtre kurmamalısınız
Filtre eşiklerini ölçmeden ayarlamak iki yönden de zarar veriyor: fazla sıkı ayarlarsanız her yanıt insan onayına düşüyor ve otomasyonun anlamı kalmıyor; fazla gevşek ayarlarsanız hatalı yanıtlar müşteriye gidiyor. Doğru eşik, sizin kendi hata dağılımınıza bakılarak bulunuyor — hangi hata türünün sizde sık olduğunu bilmeden hangi filtreyi sıkılaştıracağınızı da bilemezsiniz.
Şu kadarını rahatça söyleyebiliriz: AI'ı filtresiz ve denetimsiz bırakmak doğru değil. Yanlış bir fiyat, yanlış bir stok bilgisi veya yanlış bir sağlık ifadesi müşteriye ulaştığında bunun sonuçlarını sağlayıcı değil siz üstlenirsiniz.
2. 7 Erken Uyarı Sinyali
Sinyal 1: Sentiment kayması
Nedir? Müşteri öfkeli/üzgün/şaşkın yazmış, AI nötr veya neşeli yanıt veriyor.
Örnek (yanlış):
Müşteri: "Ürünüm 5 günde gelmedi, kargoya ne oldu yahu?!" AI: "Selam tatlım, sipariş takibin için sipariş numarana bakar mısın? 🌸"
Örnek (doğru):
Müşteri: "Ürünüm 5 günde gelmedi, kargoya ne oldu yahu?!" AI: "Çok üzgünüm, hayal kırıklığı yaşadığın için. Sipariş numaranı paylaşır mısın, hemen kargoyla iletişime geçeyim?"
Otomatik filtre: Yanıttan önce sentiment analizi. Müşteri sentiment < -0.3 (öfkeli/üzgün) + AI yanıt sentiment > +0.2 (neşeli) → insan onayına.
FendyChat'te: Otomatik açık, eşik müşteri ayarlanabilir.
Sinyal 2: Halüsinasyon (var olmayan ürün/feature)
Nedir? AI veri tabanında olmayan ürün/fiyat/feature uyduruyor.
Örnek (halüsinasyon):
Müşteri: "Pembe rengi var mı?" AI: "Evet pembe stoğumuzda 🌸 Fiyat 299 ₺, kargo ücretsiz!"
Gerçek: pembe yok, sadece beyaz/siyah var.
Filtre nasıl çalışır:
- AI yanıt ürettiğinde, sözünü ettiği ürün adı/fiyat/feature ürün katalogundan kontrol edilir
- Eşleşmiyorsa insan onayına gider
- Eşleşiyorsa direkt gider
Implementation: RAG (Retrieval-Augmented Generation) + post-generation validation. FendyChat'te shop catalog sync (ikas/Trendyol API) → her yanıt gerçek envanter ile doğrulanır.
Sinyal 3: Fiyat sapması
Nedir? AI fiyatı yanlış söylüyor — eski fiyat, indirimli fiyat, ya da hayalî.
Örnek (sapma):
Müşteri: "Bu çantanın fiyatı ne?" AI: "199 ₺ 🌸"
Gerçek katalog: 249 ₺
Filtre: Her sayısal fiyat → katalog ile karşılaştır. ±%5 dışı sapma = insan onayına.
Pratik tip: Stok azalmış ürünlerde "tükenmek üzere, ihtiyacın varsa hızlı ol" gibi stok-bilinçli yanıtlar da bu filtreye dahil edilebilir.
Sinyal 4: Marka tonu kırılması
Nedir? AI marka voice'undan dışında konuşuyor. Genelde "robotik" veya "fazla samimi" sapma.
Örnek (tonu kırılan):
Marka voice: samimi, sıcak, "tatlım" "canım" kullanır AI: "Sayın müşterimiz, talebiniz alınmıştır. Tarafımıza bildiriniz."
Filtre nasıl çalışır:
- Brand voice eğitim örnekleri (10-30 manuel yanıt) → embedding model
- Yeni AI yanıt → embedding alınır
- Brand voice ile cosine similarity < 0.65 → insan onayına
FendyChat'te: Otomatik açık. Brand voice ne kadar homojen ise filtre o kadar hassas.
Tipik şikayetler:
- E-ticaret markası: "Sayın müşterimiz" → her zaman insan onayına gönderilir
- Klinik: "Selam tatlım" → çok samimi, insan onayı
- Ajans: "Yaa kanka" → kurumsallık eksik, insan onayı
Sinyal 5: Yasak kelime / yasal sınır
Nedir? AI yasal olarak söylememesi gereken şey söylüyor.
Sektör bazlı yasak listesi (örnekler):
| Sektör | Yasak kelimeler |
|---|---|
| Sağlık (eczane, klinik) | "tedavi eder", "iyileştirir", "doktora gerek yok", spesifik ilaç önerisi |
| Finans (kripto, yatırım) | "kâr garantili", "%X getiri", spesifik yatırım tavsiyesi |
| Estetik | "kesinlikle kilo verirsin", "ameliyatsız aynı sonuç" |
| Gıda | "X hastalığa iyi gelir", "kanseri önler" |
| Genel | rakip marka adları, küfür, ayrımcı dil |
Filtre: Regex + LLM-classifier hibrit. Yasak kelime tespit → otomatik blok (insan onayı bile değil, yanıt gönderilmez).
FendyChat'te: Sektör template'inde hazır + custom liste yüklenebilir.
Sinyal 6: Çok uzun / çok kısa yanıt
Nedir? İdeal Instagram DM yanıtı 60-300 kelime. Çok uzun = okumaz; çok kısa = soğuk.
Kötü örnekler:
- 12 kelime: "Stokta var. 199 TL. Kargo ücretsiz." → soğuk
- 850 kelime: 4 paragraf + 7 bullet + "ayrıca, ek olarak..." → kimse okumaz
Filtre: Yanıt uzunluğu sektör + müşteri sorusu tipine göre hedef aralık dışı → insan onayına.
| Soru tipi | Hedef yanıt uzunluğu |
|---|---|
| "Fiyat ne?" | 30-80 kelime |
| "X ürün var mı?" | 40-100 kelime |
| "Geri iade nasıl?" | 80-200 kelime |
| "Hizmet detayı?" (klinik, ajans) | 120-280 kelime |
| Şikayet yanıtı | 60-180 kelime |
Sinyal 7: Müşteri tipi belirsizliği
Nedir? AI müşterinin kim olduğunu doğru sınıflandıramamış.
Örnek:
Müşteri: "Toplu sipariş için fiyat alabilir miyim?" AI: (perakende fiyat verir, B2B fiyat vermez)
Doğrusu:
AI: "Toplu sipariş için B2B fiyatlandırma sunuyoruz. Kaç adet düşünüyorsun? Sana özel teklif hazırlayalım."
Filtre: AI yanıt vermeden önce müşteri tipi tahmini (B2C / B2B / VIP / yeni müşteri). Tahmin confidence < %75 → "biraz daha bilgi" akışına geçer veya insan onayına gider.
3. Otomatik Filtreleme Mimarisi (Teknik)
3 katmanlı kontrol
[AI yanıt üretildi]
↓
Katman 1: Hard filters (regex + yasak liste)
├─ Geçti? → Katman 2
└─ Geçmedi → BLOK (yanıt gönderilmez, log)
↓
Katman 2: Soft filters (sentiment, sapma, ton)
├─ Geçti? → Katman 3
└─ Geçmedi → İNSAN ONAYI (panel)
↓
Katman 3: Validation (envanter, fiyat, kural)
├─ Geçti? → GÖNDER
└─ Geçmedi → İNSAN ONAYI
↓
[Müşteriye gönderildi]
↓
[Müşteri tepkisi: like, yanıt, sessizlik]
↓
Katman 4: Post-hoc analiz (haftalık)
└─ Yanıtın etkisini ölç, kötü olanları feedback olarak AI'ya gönder
Pratik: Bu mimari FendyChat'te native. İhtiyaca göre her katmanın eşikleri değiştirilebilir.
Katman 1: Hard filters (zero-tolerance)
Yasak kelime tarama:
FORBIDDEN_WORDS = [
# sağlık tavsiyesi
"tedavi eder", "iyileştirir", "doktora gerek yok",
# yatırım tavsiyesi
"kâr garantili", "yatırım yap",
# rakip marka önerisi (kendi listenize rakip adlarını ekleyin)
# küfür / ayrımcılık
# ...
]
if any(word in ai_response.lower() for word in FORBIDDEN_WORDS):
block_response()
log_incident()
Katman 2: Soft filters (insan onayına)
Sentiment kayması:
customer_sent = sentiment_analyzer(customer_message) # -1 ile +1 arası
ai_sent = sentiment_analyzer(ai_response)
if customer_sent < -0.3 and ai_sent > 0.2:
# Müşteri öfkeli, AI neşeli → INCONSISTENT
queue_for_human_approval()
Brand voice deviation:
brand_embedding = average_embedding(BRAND_VOICE_SAMPLES)
response_embedding = embed(ai_response)
similarity = cosine_similarity(brand_embedding, response_embedding)
if similarity < 0.65:
queue_for_human_approval()
Katman 3: Validation
Envanter doğrulama:
mentioned_products = extract_products(ai_response)
for product in mentioned_products:
if product not in catalog:
queue_for_human_approval()
break
if abs(extracted_price - catalog[product].price) / catalog[product].price > 0.05:
queue_for_human_approval()
4. İnsan Onay Paneli (Pratik UI)
İnsan onayına giden yanıt hızlı işlem alabilmeli — panelin işi, onaylayan kişinin kararını saniyeler içinde verebilmesini sağlamak. FendyChat panelinde ekran şöyle görünüyor:
┌────────────────────────────────────────────────┐
│ ⚠️ Yanıt insan onayı bekliyor │
│ Sebep: Sentiment kayması (müşteri öfkeli) │
├────────────────────────────────────────────────┤
│ Müşteri @ayse_modaa, 14:32 │
│ "Bu ürün sahte mi yahu, paramı isterim!" │
├────────────────────────────────────────────────┤
│ AI'nın önerisi (REDDET ▼ veya DÜZENLE ✏️): │
│ │
│ "Sahte ürün satmıyoruz 🌸 Ürün takip │
│ linkini paylaşır mısın, kontrol edelim?" │
├────────────────────────────────────────────────┤
│ [✅ GÖNDER] [✏️ DÜZENLE] [❌ REDDET] │
└────────────────────────────────────────────────┘
Eczacı/Doktor/Ajans CEO kararı:
- ✅ Gönder: AI yanıt iyi, direkt
- ✏️ Düzenle: AI yanıtın bir kısmını düzeltir (örn. "Sahte değil — kalitemizi garanti ediyoruz, iadeden %100 para iadesi veriyoruz")
- ❌ Reddet: Yanıt kötü, manuel yanıt yazılır
Önemli: Reddedilen yanıtlar AI'ın feedback loop'una girer → bir sonraki benzer durumda AI öğrenir.
5. Sektörel Filtre Şiddeti Önerileri
Sektör başına "şu oranda insan onayı olmalı" diye sayı vermiyoruz; bu oranı sizin hata dağılımınız ve risk toleransınız belirliyor. Ama filtre şiddetini hangi sıraya göre ayarlayacağınızı söyleyebiliriz:
| Filtre şiddeti | Hangi işler | Neden |
|---|---|---|
| Düşük — çoğu yanıt otomatik | Moda, kozmetik, aksesuar, yerel hizmet (restoran, salon) | Yanlış yanıtın maliyeti genelde bir düzeltme mesajıyla kapanıyor |
| Orta | Yiyecek-içecek, mobilya, teknoloji, eğitim | Ürün/hizmet bilgisi karmaşık, hatalı bilgi sipariş iptaline veya iadeye yol açabiliyor |
| Yüksek — hassas konularda mutlaka insan | Sağlık (klinik, eczane), finans | Yanlış yanıt yalnızca ticari değil hukuki sonuç doğuruyor; ayrıca bu alanlarda tanıtım ve tavsiye mevzuatı sınırlı |
Genel kural: Yanlış yanıtın size maliyeti ne kadar yüksekse (yasal yaptırım, marka itibarı, ciro kaybı), insan onayına giden yanıt oranı o kadar yüksek olmalı.
Sağlık ve finans için özel not: Bu alanlarda mesele filtre eşiği ayarlamaktan öte. Sağlık hizmetlerinin tanıtımı ve yatırım tavsiyesi verilmesi Türkiye'de ayrı mevzuatlara tabi; hangi ifadeyi kullanabileceğiniz ve müşteriye ne söyleyebileceğiniz kısıtlı. Bu sektörlerdeyseniz otomatik yanıt akışınızı kurmadan önce kendi meslek odanızın ve ilgili düzenleyici kurumun güncel kurallarını teyit edin. Ayrıca hasta veya finansal bilgi içeren mesajlar özel nitelikli/hassas veri kapsamına girebilir; bunu KVKK yükümlülükleriniz açısından ayrıca değerlendirin.
6. Aylık Kalibrasyon Ritmi
Her hafta (30 dk)
- Cuma 16:30: Geçen hafta gönderilen 20 random AI yanıtı oku
- Her birini 4 metrikle puanla: doğruluk, ton, marka uyumu, yasal sınır (1-5)
- 3.5 altı olanları "kötü" işaretle → feedback loop
Her ay (2 saat)
- Ay sonu: Aylık metrik özeti — üç sayıyı çıkarın ve geçen ayla karşılaştırın:
- Yanlış-pozitif oranı (gereksiz yere insan onayına düşen yanıtlar)
- Yanlış-negatif oranı (filtreyi geçip müşteriye giden hatalı yanıtlar)
- Marka tonu tutarlılığı (haftalık puanlamalarınızın ortalaması)
- Hedef sayıyı biz vermiyoruz: ilk ölçümünüz sizin tabanınız, sonraki ayların işi o tabanı iyileştirmek
- Filtre eşiklerini ayarla:
- Yanlış-pozitif fazla → eşikleri gevşet (insan az çağrılır)
- Yanlış-negatif fazla → eşikleri sıkılaştır (insan çok çağrılır)
Her çeyrek (4 saat)
- Brand voice eğitim örneklerini güncelle (son ay gerçek manuel yanıtlardan 30 örnek)
- Yasak kelime listesini gözden geçir (yeni rakip, yeni regülasyon)
- Catalog sync entegrasyonunu test (envanter doğrulama çalışıyor mu?)
7. Yanlış Yanıt Çıktığında Kriz Yönetimi
Filtre yakalamadı, yanlış yanıt müşteriye gitti. Ne yapmalı?
Adım 1: Hızlı tespit
- Müşteri şikayet ediyorsa (sentiment < -0.5 takip yanıt) → otomatik alarm
- Public yorum → 30 dk içinde manuel yanıt
Adım 2: Düzeltme
- "Yanılmışım, gerçek bilgi: ..." şeklinde dürüst düzeltme
- Hediye/indirim (10-30 ₺) ile özür
Adım 3: Kayıt + öğrenme
- Olay log'a düşer (FendyChat'te incident report)
- Filtre eşikleri bu vakaya göre sıkılaşır
Adım 4: Önleme
- Aynı pattern bir daha = kalıcı filtre kuralı
Sıkça Sorulan Sorular (SSS)
AI yanıt kalitesi nasıl ölçülür?
4 boyutta puanlayarak: doğruluk (fiyat, stok), ton (marka sesi), marka kuralları (yasak ifade), yasal sınır (sektöre özel). Hedef oranı biz belirlemiyoruz — ilk ölçümünüz tabanınız olur, sonraki aylarda onu iyileştirirsiniz. Yöntem 1. bölümde.
Hibrit mod ne kadar yavaşlatır?
Otomatik gönderim anında oluyor; insan onayına düşen yanıt ise onaylayan kişi paneli görene kadar bekliyor. Yani gecikmeyi belirleyen şey yazılım değil, sizin ekibinizin bildirime ne kadar hızlı dönebildiği. Bu yüzden onay bildirimlerinin gerçekten görülen bir kanala düşmesi (telefon bildirimi, ekip kanalı) kritik.
İnsan onayı ne kadar zaman alır?
Panelde yanıt hazır geldiği için karar genelde birkaç saniyelik bir iş: gönder, düzenle veya reddet. Günlük toplam yükü kendiniz hesaplayabilirsiniz: insan onayına düşen günlük yanıt sayısı × onay başına geçen süre. Bu sayı sizin için kabul edilemez ölçüde büyükse çözüm daha çok mesai değil, filtre eşiklerini kalibre etmek.
AI hata oranı sıfıra indirilebilir mi?
Hayır. Doğru hedef "hiç hata olmasın" değil, hatanın müşteriye ulaşmasını engellemek ve ulaştığında hızlı düzeltmek. Filtre + insan onayı bu ikisini sağlıyor; ölçmediğiniz sürece nerede olduğunuzu bilemezsiniz.
Yanlış-pozitif oranı yüksekse ne yapmalı?
Filtre eşiklerini gevşet (sentiment threshold -0.3 → -0.4, brand similarity 0.65 → 0.55). Az insan müdahalesi, az gereksiz iş.
Brand voice eğitim örneklerini ne kadar tutmalı?
10-30 örnek ideal. 10 altında: AI tutarsız. 30 üstünde: marjinal getiri. Aylık güncellenmeli.
Sentiment analizi hangi dil için çalışır?
FendyChat'te native Türkçe (custom-trained model). İngilizce, Arapça da var. Diğer diller için topluluk modelleri.
Yasak kelime listesi nasıl yönetilir?
Sektör template'inde hazır (eczane, klinik, finans için ön-yüklü). Custom kelimeler de eklenebilir (rakip marka, sektörel yeni terim). Liste haftalık genişler.
AI'ı hiç kullanmamak daha güvenli olmaz mı?
Manuel yanıtta hata yapma riski sıfır değil, sadece hatanın türü değişiyor: yanlış bilgi yerine hiç verilmeyen bilgi ve gecikme. Kendi yanıt sürenizi bir hafta ölçün — gece ve hafta sonu gelen mesajların ne kadarına zamanında dönebildiğinizi gördüğünüzde karşılaştırma somutlaşır. AI + filtre + insan onayı kurgusunun amacı manuel kaliteyi korurken gecikmeyi kaldırmak; kaliteyi koruyup korumadığını ise 1. bölümdeki ölçümle kendiniz denetlersiniz.
Halüsinasyon kontrolünü kim yapar?
RAG mimarisi: AI yanıt verirken ürün katalog + sıkça sorulan sorular veritabanı ile sentezler. Yanıttaki ürün adı/fiyat post-generation olarak katalog ile karşılaştırılır. Eşleşmezse insan onayı.
Eşik ayarlama (threshold tuning) ne sıklıkla yapılmalı?
İlk 2 hafta: günlük (yoğun kalibre). Sonraki 4 hafta: haftalık. 2 ay sonra: aylık (stabil sistem).
Sonuç
AI yanlış yanıt verir — bu kaçınılmaz. Fakat:
- 7 erken uyarı sinyali ile hatalı yanıtın büyük kısmı müşteriye gitmeden ayıklanabiliyor
- 3 katmanlı filtre (hard / soft / validation) yayına çıkan hatayı düşürmenin en pratik yolu
- İnsan onay paneli ile kritik kararlar her zaman insan kontrolünde kalıyor
- Kalibrasyon ritmi olmadan filtre ayarları körlemedir — ölçmeden eşik ayarlamayın
- Filtre şiddetini riske göre ayarlayın: sağlık ve finans gibi alanlarda hassas konuları otomatik akışa hiç bırakmayın ve mevzuat sınırlarını kendi meslek kuruluşunuzdan teyit edin
🌸 FendyChat bu 3 katmanlı filtreyi, insan onay panelini ve haftalık raporu ürünün içinde sunuyor; kalibrasyon kontrol listesi ve sektör template'leri de hazır geliyor. Sizin hesabınızda hangi doğruluk seviyesine ulaştığını ise 1. bölümdeki ölçümle kendiniz görebilirsiniz — biz bir oran taahhüt etmiyoruz, ölçülebilir bir sistem veriyoruz.