VoxSim nasıl çalışır?
VoxSim'in çalışma mantığını, doğrulama yöntemlerini ve sınırlamalarını açık bir dille anlatan metodoloji rehberi.
Birincil eksen: 12 siyasi küme + yankı odası
VoxSim simülasyonun birincil ekseninde demografi değil, siyasi eğilim vardır. Türkiye toplumu 12 siyasi kümeye bölünür (sosyal demokrat, dindar muhafazakar, milliyetçi muhafazakar, kürt siyasi, genç kararsız, vb). Her küme kendi yankı odasından beslenir.
Her küme için haber kaynakları dört zaman penceresinde taranır; yapay zeka bu zaman-ağırlıklı haber ortamını okuyarak kümenin şu anki ruh halini, şikayetlerini ve baskın anlatı çerçevelerini çıkarır. Söylem değerlendirmesi bu canlı bağlama karşı yapılır.
Her kümenin gösterilen nüfus payı (%oran), ulusal kamuoyu araştırmaları ve seçim verilerinden elde edilen çapraz tablo tahminlerine dayanır. Türkiye'nin lider bağımsız kamuoyu araştırma kuruluşundan türetilmiş yaşam tarzı tipolojisi (LKA takma adıyla anılır) bu tahminlerin temel çerçevesini oluşturur. Kaynak kuruluşun ticari veri lisansı kapsamında ismi gizli tutulur; ham tablolar yeniden yayınlanmaz, yalnızca istatistiksel çıkarım aktarılır.
12
siyasi küme
10
haber kaynağı / küme
4
zaman penceresi
Bourdieu 3-Kapital × LKA Alt-tipoloji
Her küme için Bourdieu (Distinction, 1984) 3-kapital teorisi (ekonomik · kültürel · sosyal) ve LKA'nın Ekim 2024 tarihli kamuya açık alt-tipoloji çalışması uygulandı. Tablo; kümelerin toplumdaki konum ve eğilimlerini özetler; bireysel profil değildir. Bu sermaye haritası yapay zekanın Türkiye bağlamına özgü siyasi davranış modellemesini güçlendirir. Profil 2026-09-17'den itibaren üretim sorgularına eklenmiyor; ablasyon katkısını gürültüden ayırt edemedi.
| Küme | Ekonomik | Kültürel | Sosyal | LKA Alt-tip |
|---|---|---|---|---|
| ulusalci_sol | 3 | 4 | 4 | Modern Seküler |
| sosyal_demokrat | 4 | 5 | 4 | Modern |
| liberal_kentli | 5 | 5 | 3 | Liberal Modern |
| merkez_sag | 3 | 3 | 4 | Muhafazakar Modern |
| dindar_muhafazakar | 3 | 3 | 5 | Dindar Muhafazakar |
| islamci_taban | 2 | 3 | 5 | Dini Muhafazakar |
| milliyetci_muhafazakar | 2 | 3 | 4 | Geleneksel Muhafazakar |
| iyi_parti_merkez | 4 | 4 | 3 | Liberal Muhafazakar |
| kurt_siyasi | 2 | 3 | 5 | Geleneksel-Etnik |
| genc_kararsiz | 2 | 4 | 2 | Modern Genç |
| kentli_kararsiz | 3 | 4 | 2 | Modern |
| anadolu_kararsiz | 2 | 2 | 4 | Geleneksel Muhafazakar |
1 = çok düşük, 5 = çok yüksek. Lacivert tonları yüksek sermaye, amber tonları düşük sermaye.
Akademik referanslar: Bourdieu (1984) — Distinction: A Social Critique of the Judgement of Taste (Harvard UP); Çarkoğlu & Kalaycıoğlu (2021) — Fragile but Resilient? Turkish Electoral Dynamics, 2002–2015 (U. Michigan Press); Çarkoğlu & Kalaycıoğlu (2020) — Elections and Public Opinion in Turkey (Routledge); Çarkoğlu & Toprak (2007) — Religion, Society and Politics in a Changing Turkey (TESEV).
12 siyasi kümeyi keşfedin
Her kümenin profil, bilgi ekolojisi, dönen anlatılar ve haftalık snapshot geçmişi.
Bilgi ekolojisi haritalama (3-tier hibrit kaynak)
Büyük haber ajanslarının doğal kalite filtresi, bir kümeyi gerçekten tanımlayan bazı kritik kaynakları dışarıda bırakır. Niş yayıncılar — özellikle ideolojik odaklı medya organları — küresel kataloglarda yer almaz; ama belirli siyasi kümelerin gerçek ruh halini ve kaygılarını anaakım kaynaklardan çok daha iyi yansıtır.
VoxSim bu boşluğu hibrit kaynak yapısıyla kapatır: yayıncıların kendi RSS akışları üzerinden derlenen çok katmanlı bir haber tabanı oluşturulur (anaakım + niş + yankı odası). Her içerik parçası kaynak kalitesi ve tipi bakımından sınıflandırılır.
Anaakım doğrulanmış
Geniş okuyucu kitlesine sahip büyük haber kuruluşları — editoryal standartı yüksek, içerik doğrulama süreçleri yerleşik.
Niş doğrulanmış
Belirli bir kitleye hitap eden, editoryal standartlarını koruyan niş yayıncılar.
Niş doğrulanmamış
Küçük yayıncılar — doğrulanmamış ama küme için sinyal verebilir.
Yankı odası
Belirli bir siyasi kümenin iç dünyasını yansıtan ideolojik yayıncılar — kümenin gerçek ruh halini okumak için kritik kaynaklar.
Dezenformasyon (küme tüketiyor)
Dezenformasyon örüntüsü taşıyan kaynaklar — VoxSim bu içeriklerin doğruluğunu onaylamaz; yalnızca kümenin neyi tükettiğini sosyolojik bir gözlem olarak ölçer.
Önemli metodoloji notu
VoxSim bilgi ekolojisi haritalaması yapar — kümenin TÜKETTİĞİ gerçeği ölçer, hangi gerçeğin doğru olduğuna karar vermez. Bu Sunstein, Bail ve Levy'nin akademik echo chamber çalışmalarının standart metodolojik çerçevelemesidir.
- ✓Disinformation tier içeriği VoxSim tarafından doğru olarak yayınlanmaz; "küme bunları tüketiyor" sinyali olarak işlenir.
- ✓Yapay zekaya açık bir yönerge verilir: görev doğrulama değil, bilgi ekolojisi haritalama.
- ✓Müşteri raporlarında ekolojik kompozisyon görsel olarak şeffaflıkla gösterilir (mainstream %X, echo chamber %Y, disinformation %Z).
Akademik referanslar: Sunstein (2017) — #Republic: Divided Democracy in the Age of Social Media (Princeton UP); Bail (2021) — Breaking the Social Media Prism (Princeton UP); Levy (2021) — Social Media, News Consumption, and Polarization (American Economic Review); Cinelli et al. (2021) — The Echo Chamber Effect on Social Media (PNAS); Bakshy, Messing & Adamic (2015) — Exposure to Ideologically Diverse News on Facebook (Science); Garrett (2009) — Echo Chambers Online? Selective Exposure Among Internet News Users (JCMC).
Günlük yankı odası pipeline'ı
Her kümenin snapshot'ı her gece dört aşamalı pipeline ile yeniden inşa edilir. Toplam süre ≈ 30 dakika; 02:30–03:30 İstanbul saatleri arasında çalışır. Gün içindeki simülasyonlar her zaman bir önceki geceye ait context okur. Önemli kısıt: gün içinde patlak veren anlık krizler, aynı gece pipeline'ı tamamlanana kadar snapshot'a dahil değildir — Modül B bu durumda Olay Enjeksiyonu (Modül E, Karargah+) ile tamamlanmalıdır.
Gece çalışma akışı (Istanbul saatiyle)
Makale ingest
Yayıncıların kendi RSS feed'leri (mainstream + niche). Kaynak başına son ~2 gün makale.
02:30 TR · gece boyu otomatik çalışır
Makale başına özet
Her makale ≤200 kelimelik yapılandırılmış özete dönüştürülür. Orijinal metin saklanmaz.
02:45 TR · LLM çıkarım aşaması
Vektör embedding
Başlık + özet → yüksek boyutlu semantik vektör. Semantik arama ve küme centroid hesabı için kullanılır.
02:50 TR · semantik indeksleme
Küme snapshot rebuild
Küme başına: zaman-ağırlıklı özet örneklemesi → LLM ruh hali, şikayetler ve lexicon kompoze eder.
03:00 TR · 12 küme · gece snapshot
Aşamalar paralel çakışmayı önleyen kilitle sıralı çalışır. Bir aşama başarısız olursa sonraki yine de dünkü veriyle çalışır — sessiz bozulma yok.
Üstel unutma eğrisi (w = exp(−t/τ))
Her makaleye yaşına göre <strong>w(t) = exp(−t / τ)</strong> ağırlığı verilir; bucket ağırlıkları bu eğrinin pencere sınırları üzerindeki integralinden deterministik olarak türetilir. τ (tau) zaman sabiti tek doğruluk kaynağıdır — yarı-ömür τ·ln(2). Murre & Dros (2015 PLOS ONE) Ebbinghaus replikasyonu ve Wu et al. (2007 PNAS) haber dikkat decay literatürüne dayanır.
Bucket ağırlıkları canlı hesaplanır — config değiştiğinde otomatik güncellenir. Yapay zekaya her pencere için ortalama makale tazeliği (pencere integrali ÷ pencere uzunluğu) iletilir; toplam kütle yalnızca makale kotası ve token bütçesi için kullanılır.
Kaynak anonimliği
Tüm public yüzeyler — config dosyaları, API yanıtları, PDF raporlar, audit log'lar, bu sayfa — haber kaynaklarını yalnızca codename ile gösterir (örn. ULS_01, MRS_03). Gerçek kaynak URI mapping'i sadece Talivio compliance ekibinin erişebildiği şifreli bir dosyada bulunur.
Public (kod, log, rapor)
ULS_01, MRS_02, DNM_05, …
Codename'ler taxonomy versiyonları arasında kararlı — müşteri dashboard kurabilir.
Şifreli mapping
[encrypted · ops-only]
Gerçek yayın URI'leri. Rotation politikası + her okumada erişim audit.
Backtest temporal pin
VoxSim tarihsel bir olayı simüle ettiğinde (örn. Şubat 2023 depremi), bugünün küme snapshot'ını kullanmak yanıltıcı olur — 2023'te kümelerin inançları farklıydı. Backtest, event_date tarihinde veya öncesinde aktif olan snapshot versiyonunu seçer.
Snapshot'lar append-only
Eski snapshot'lar asla overwrite edilmez. 2024-09 olayı için bir simülasyon 2024-09-15 snapshot'ını okur, en güncelini değil. Bu Doğruluk Skoru kalibrasyonunu dürüst kılar — bir kümenin geçmiş inançlarını retroaktif olarak "düzeltme" hakkımız yok. ⚠ Bugünkü durum: yankı odası arşivi 30 Nisan 2026'da başladı; kalibrasyon setindeki tüm tarihsel olaylar bundan önce olduğu için backtest'ler şu an yankı odası bağlamı OLMADAN koşar (küme kimliği + demografik çapa). Güncel bir snapshot'ı geçmiş olaya vermek geleceği sızdıracağı için bilinçli olarak yapılmaz. Yankı odasının katkısı bu nedenle güncel anketlerde ayrı bir ablasyon koluyla ölçülür (04.7).
Günlük güncelleme maliyeti
Günlük yankı odası güncellemesi minimum maliyetle çalışır: RSS içerik toplama tamamen ücretsiz; yapay zeka işleme gideri ise simülasyon başına değil, 12 küme için sabit günlük bütçe içinde kalır. Bu mimari, platform sürdürülebilirliğini garanti eder.
Akademik referanslar: Murre & Dros (2015) — Replication and Analysis of Ebbinghaus' Forgetting Curve (PLOS ONE); Tversky & Kahneman (1973) — Availability: A Heuristic for Judging Frequency and Probability (Cognitive Psychology).
İkincil eksen: demografik nüans
Siyasi kümenin yanında ikincil bir eksen daha çalışır: demografik dağılım. Türkiye'nin yetişkin nüfusu üç bağımsız boyutta kesiştirilerek istatistiksel bir model oluşturulur: coğrafya (NUTS-2 bölgeleri), sosyo-ekonomik düzey (SES) ve kültürel-yaşam tarzı kümesi. Bu üç boyutun her kombinasyonu 26 × 4 × 3'lük matrisin bir hücresini oluşturur.
Her hücredeki sentetik ajanlar, kamuya açık demografik anketlerden ve nüfus sayımı verilerinden türetilmiş istatistiksel dağılımlar taşır. Hiçbir gerçek birey temsil edilmez; her ajan prosedürel olarak üretilmiş istatistiksel bir bileşimdir.
26
NUTS-2 coğrafi bölge
4
Sosyo-ekonomik düzey (AB · C1 · C2 · DE)
3
Kültürel-yaşam tarzı kümesi
Üç yaşam tarzı kümesi, Türkiye toplumunun laiklik, gelenek ve dindarlık konusundaki öz-tanımlama örüntülerine ilişkin araştırmaları yansıtır. Yaklaşık ulusal oranlar şöyledir: (Veriler: TÜİK ADNKS ve LKA'nın kamuya açık yaşam tarzı araştırması).
Modern / Laik ~%34
Kentsel odaklı, dijital doğan, laik değer sistemi, yüksek eğitim yoğunluğu
Geleneksel Muhafazakâr ~%42
Anadolu kökleri, aile ve toplum odaklı, ılımlı dindarlık, hızlı değişime mesafeli
Dindar Muhafazakâr ~%24
Yüksek dindarlık, cemaat bağı güçlü, değer odaklı, doğu ve iç bölgelerde yoğun
Akademik referanslar: Beckman, Baggerly & McKay (1996) — Creating Synthetic Baseline Populations (Transportation Research A); Müller & Axhausen (2011) — Hierarchical IPF: A Synthetic Population for Switzerland (ERSA); Park et al. (2023) — Generative Agents: Interactive Simulacra of Human Behavior (UIST); Argyle et al. (2023) — Out of One, Many (Political Analysis); Aher, Arriaga & Kalai (2023) — Using LLMs to Simulate Multiple Humans (ICML).
Tarihsel olay kalibrasyonu
Bir simülasyon motoru yalnızca kalibrasyonu kadar iyidir. VoxSim popülasyon modelini, nesnel bir çıktının — seçim sonucu veya güvenilir anket verisi — gerçek ölçüm sağladığı tarihsel olaylara karşı doğrular. Bu süreç backtest kalibrasyonu olarak adlandırılır.
-
1
Tarihsel olayları derle
Her olay tarih, kategori, açık bir Türkçe açıklama ve Wikipedia, Resmî Gazete, haber arşivleri gibi kamuya açık kaynaklara yönlendiren URL ile belgelenir.
-
2
Referans verisini belirle
Yalnızca nitelikli referans ölçümü olan — ulusal seçim sonucu, güvenilir anket veya resmî istatistik — olaylar kalibrasyon setine girer. Bu, ayrıştırıcı ölçüttür.
-
3
Popülasyon simülasyonu çalıştır
Olay açıklaması simülasyon motoruna iletilir; motor tüm popülasyon hücrelerinde duygusal tepkiyi (öfke, korku, umut, ilgisizlik, destek) tahmin eder.
-
4
Gerçek ölçümle karşılaştır
Tahmin edilen dağılımlar çıpa ölçümüyle karşılaştırılır. Seçimlerde oy payı değişimleri segment düzeyi destek tahminlerine dönüştürülür; anket sorularında doğrudan duygu soruları doğrulama sağlar.
-
5
Yinele ve yeniden kalibre et
Sistematik sapmalar model yanlılıklarını ortaya koyar (örn. kırsal dindarlığın eksik ağırlıklandırılması). Parametreler ayarlanır ve kalibrasyon seti ortalama mutlak hata dengelenene kadar yeniden çalıştırılır.
Kalibrasyon için koşul katıdır: bir olay ancak yaklaşık altı ay içinde nitelikli bir ölçüm (seçim veya anket) bulunması durumunda sete dahil edilir. Bu kural, tahmin edilen toplumsal tepkinin bağımsız bir sinyalle karşılaştırılabilmesini sağlar.
Seçim sonuçları
1983'ten bu yana tüm seçimler için YSK sandık ve ulusal oy payı verileri
Anket araştırması
Güvenilir ulusal anket firmalarının yayımlanmış toplu sonuçları
Resmî istatistikler
TÜİK, TCMB ve diğer devlet kurumlarınca yayımlanan toplu veriler
Akademik referanslar: Brier (1950) — Verification of Forecasts (Monthly Weather Review); Tetlock (2005) — Expert Political Judgment (Princeton UP); Hyndman & Koehler (2006) — Forecast accuracy measures; Gneiting & Raftery (2007) — Strictly Proper Scoring Rules (JASA).
Doğruluk skoru hesaplama
Her backtest çalışması olay bazında bir doğruluk tahmini üretir. VoxSim'de raporlanan genel doğruluk skoru, tüm kalibrasyon olaylarının olay güvenilirliğiyle ağırlıklandırılmış ortalamasıdır.
Doğruluk metrikleri (4 skor yan yana raporlanır)
Brier (1950) ve Log-skor (Gneiting-Raftery 2007), istatistiksel olarak katı tahmin değerlendirme ölçütleridir (proper scoring rules); normalize edilmiş duygu dağılımı üzerinde hesaplanır. RMSE yalnızca ortalama-tahmin (mean-prediction) için proper'dır. CRPS (Gneiting-Raftery 2007), sürekli dağılımlar için ek bir katı ölçüttür. MAE ve Doğruluk (1−MAE/100) geriye uyumluluk için korunmaktadır. LLM tabanlı sentetik bir sistemde Brier skoru model tutarlılığını ölçer; sahadaki frekantist seçmen dağılımının doğrulaması değildir. Önemli sınır: duygu skorları bağımsız 0-100 yoğunluktur, olasılık dağılımı değil; Brier/Log-skor bunları toplamı 1'e zorla normalize ettiği için yalnızca duygu profilinin GÖRECELİ şeklini ölçer — (80,80,10,10,10) ile (40,40,5,5,5) aynı Brier'i alır. Ham yoğunluk hatasını kaybetmeyen birincil metrik MAE'dir; Brier/Log-skor ikincil şekil-sadakati göstergesidir.
Skor konu kategorisine (ekonomik, siyasi, güvenlik vb.) göre ayrıştırılır; kullanıcılar modelin hangi politika alanlarında daha başarılı, hangilerinde daha zayıf olduğunu tam olarak görebilir. Her skor, onu üreten belirli olaylara geri bağlantı verir — kara kutu değil, tam şeffaflık.
Güncellenmiş metodoloji ile yapılan 46 olaylık tam A/B testi: ağırlıklı doğruluk %81,84, ortalama mutlak hata 18,16 puan. Önceki metodoloji 50 olaylık testte %62,31 idi. Adil karşılaştırma (aynı 6 olay): %80,94 → %82,60 = +1,66 puan. İki dürüstlük notu: (1) Olayların küme × duygu referans tabloları doğrudan ölçülmüş çapraz tablolar değil, yayımlanmış anket ve seçim verisinden çıkarsanmış tablolardır; doğruluk skoru bu referansa göre iç tutarlılığı ölçer. (2) Doğruluk tek başına yeterli değildir: her küme×duygu için diğer olayların ortalamasını tahmin eden önemsiz bir taban çizgisi (klimatoloji) de benzer bir doğruluk alabilir. Bu yüzden modelin taban çizgisine göre becerisi ayrıca raporlanır (aşağıda; ölçülmemişse "henüz ölçülmedi" yazar).
%81.84
Faz 1.8 (46 olay)
%62.31
Faz 1.5/1.6 (50 olay)
+1.66 pp
same-events (6)
Beceri skoru (klimatoloji taban çizgisine göre)
+0.03
skill
15.26 / 15.72
MAE model / baseline
36 / 67
klimatolojiyi geçen olay
Taban çizgisiyle aynı
1 − MAE_model / MAE_taban. 0 = taban çizgisi kadar; pozitif = daha iyi. Taban çizgisi: her küme×duygu için diğer olayların ortalaması (leave-one-out).
Akademik referanslar: Willmott & Matsuura (2005) — Advantages of MAE over RMSE (Climate Research); Hyndman & Koehler (2006) — Another look at measures of forecast accuracy (Int'l J. Forecasting); Gneiting & Raftery (2007) — Strictly Proper Scoring Rules (JASA).
Küme başlangıç dağılımlarının YSK ile tutarlılığı (2002–2024, 8 çapa)
Her kümenin elle kürlenmiş tarihsel oy dağılımı nüfus payıyla ağırlıklandırılıp ulusal toplama dönüştürülür ve YSK sonucuyla karşılaştırılır. Bu bir bağımsız doğrulama DEĞİLDİR: dağılımlar bu seçimlere bakılarak kürlendiği için sonuç örneklem-içi (in-sample) tutarlılık ölçüsüdür — kümelerin toplamının resmi sonuca aritmetik olarak oturduğunu gösterir, modelin öngörü gücünü değil. Yapay zeka çağrısı içermez. Aşağıdaki 8 çapa (2002, 2007, 2011, 2015 Haziran, 2015 Kasım, 2018, 2023, 2024 yerel) bütünleşik skoru üretir; 2014 öncesi çapalar bugünkü küme yapısına geriye yansıtılmıştır.
2002 Milletvekili
88/100
2007 Milletvekili
94/100
2011 Milletvekili
94/100
2015 Haziran Milletvekili
98/100
2015 Kasım Milletvekili
100/100
2018 Milletvekili
99/100
2023 Milletvekili
98/100
2024 Yerel Seçim
98/100
KOMPOZİT SKOR 96/100 (Yüksek güven)
8 çapa ortalamasıdır. Yüksek skor kürlenmiş dağılımların iç tutarlılığını gösterir; öngörü kalitesi için 04.7'deki ölçüm programına bakın.
Tahmin kalitesi kırılımı
proper0.0002
Brier
1.698
Log-score
0.009
RMSE
Brier (1950) + Log-score (Gneiting-Raftery 2007) strictly proper. RMSE point-prediction proper. calibration_score TVD-tabanlı (gevşek-proper).
Skorlar her gün otomatik olarak yeniden hesaplanır; model parametreleri güncellendiğinde anlık olarak yansıtılır. Bu hesaplamalar yapay zeka çağrısı gerektirmez — tamamen deterministik matematiksel işlemlerdir.
Türkiye siyasi kırılma noktaları (2015 — günümüz)
Kalibrasyon ankorlarının arkasındaki olay zinciri: seçimler, yargı kararları, ekonomik şoklar — kaynaklı kronoloji.
Replikasyon varyansı & algoritmik sadakat
Referans alınan iki temel akademik uyarıya karşı sisteme koruma katmanları eklendi. Aşağıdaki her iki test de canlı veri üzerinden çalışır.
Prompt kararsızlığı — Bisbee (2024) replikasyon taraması
Bisbee ve ark. (2024), Political Analysis dergiside şu uyarıyı yapar: yapay zeka tabanlı sentetik anketler aynı soruyu farklı söyleyişle test edildiğinde tutarsız sonuçlar üretir; tek bir çıktıya güvenmek yanıltıcıdır. VoxSim her şablon için 5 kez tekrar ölçümü yapar, varyans katsayısını hesaplar ve üç kararlılık bandına ayırır: kararlı / orta / kararsız. Haftalık otomatik tarama üretim şablonunu örneklem bazlı ölçer; ayrıca 2026-08 ölçüm programı tek çağrılık anketin koşudan koşuya gürültü tabanını 4,7–5,8 puan olarak ölçmüştür (bkz. 04.7).
| Şablon | Bağlam | N | CV | Stabilite |
|---|---|---|---|---|
| synthetic_poll | milliyetci_muhafazakar | 5 | 0.1156 | moderate |
| synthetic_poll | sosyal_demokrat | 5 | 0.2095 | unstable |
| synthetic_poll | merkez_sag | 5 | 0.0415 | stable |
Monte Carlo belirsizlik bandı ve LLM stokastisitesi
Rapor PDF'lerindeki ± değerleri tek bir koşunun iç güven ölçüsü değildir; aynı simülasyonun N bağımsız Monte Carlo koşusunun standart sapmasından türetilir. Büyük dil modelleri deterministik değildir: örnekleme sıcaklığı ve bağlam etkileri nedeniyle aynı girdi her koşuda bir miktar farklı çıktı üretir. VoxSim bu doğal stokastisiteyi bastırmak yerine ölçer ve raporlara belirsizlik bandı olarak yansıtır.
Dar bir bant kesinlik garantisi değildir — yalnızca modelin kendi içinde tutarlı olduğunu gösterir; sistematik yanlılık (bias) bant genişliğine yansımaz. Geniş bant ise söylemin ilgili küme için "hassas bölgede" olduğuna işaret eder. Bu nedenle bant, gerçek dünya hata payı gibi değil, model tutarlılığı göstergesi olarak okunmalıdır.
Algoritmik sadakat — Argyle (2023)
Argyle ve ark. (2023) merkezi önerisi: sentetik popülasyon modelinin demografik altgrupları gerçek alan araştırması bulgularıyla tutarlı biçimde temsil etmesi zorunludur. VoxSim'de 12 küme tahmini, 3 yaşam tarzı segmentine (modern / geleneksel / dindar) toplanarak LKA'nın aylık kamuoyu araştırmasının yayımlanmış çapraz tablolarıyla karşılaştırılır. Sadakat skoru 1.0 = mükemmel örtüşme, 0.0 = tam ayrışma anlamına gelir.
2023
0.767
HIGH · 3 seg
2018
0.761
HIGH · 3 seg
2024_local
0.809
HIGH · 3 seg
Segment bazında ayrıntılı tablo
2023
modern
0.842
gelenekci
0.690
dindar
0.770
2018
modern
0.807
gelenekci
0.654
dindar
0.823
2024_local
modern
0.927
gelenekci
0.677
dindar
0.821
Kültürel önyargı azaltımı — Atari (2023)
Atari ve ark. (2023) bulgusu: büyük dil modelleri, Batı/kentsel/yüksek gelirli toplumlar dışındaki kültürlerde (kolektivist yapılar dahil) sistematik önyargı gösteriyor. Türkiye bu risk grubuna girer. Azaltım yöntemi: 12 küme için 36 Türkçe örnek davranış kalıbı (yalnızca YSK + LKA agregat verisi; bireysel profil değil) yapay zekaya örnekler olarak gösterilir. Bu sayede modelin siyasi yorum ve oy gerekçelendirmesi Türkiye bağlamına kalibre olur.
12
Cluster
36
Örnek
Not
Bu örnek kalıplar 2026-09-17'den itibaren üretim sorgularına eklenmiyor: iki bağımsız ankette yapılan ablasyon katkılarını gürültüden ayırt edemedi. Kütüphane ölçüm kolu olarak korunur.
Akademik referanslar: Bisbee et al. (2024) — Synthetic Replacements for Human Survey Data? The Perils of LLMs (Political Analysis); Argyle et al. (2023) — Out of One, Many: Using LLMs to Simulate Human Samples (Political Analysis).
Ölçüm dürüstlüğü programı — skor neyi ölçüyor?
Modül K'nın kalibrasyon skoru, modele verilen başlangıç dağılımı resmi sonuçtan türetildiği için tek başına yanıltıcı olabilir: dağılımı olduğu gibi geri yazan bir model bile yüksek puan alır. 2026 Ağustos'ta bu soruyu doğrudan ölçen dört test kuruldu ve iki bağımsız üretim anketinde, sabitlenmiş tek bir model altında koşuldu. Sonuçlar ve alınan kararlar aşağıdadır; ölçüm dosyaları sürüm kontrolünde saklanır.
Tekrar kararlılığı ve gürültü tabanı
Aynı anket aynı girdilerle üç kez, önbellek atlanarak koşuldu. Gürültü tabanı = en büyük parti standart sapmasının iki katı. Sonuç: 4,65, 5,79 ve 9,31 puan (üç anket). Karar: tek çağrılık anket parti düzeyinde bu bandın altındaki farkları taşıyamaz; zaman serisi grafiklerinde bant gri çizilir ve anketler artık varsayılan olarak bağımsız koşuların ortalaması olarak üretilir.
Plasebo taban çizgisi (papağan testi)
Üç kol: gerçek başlangıç dağılımı · başlangıç dağılımı yok · parti etiketleri karıştırılmış plasebo dağılım. Hipotez, modelin başlangıcı papağan gibi tekrarladığıydı; tersi çıktı: model başlangıçtan belirgin biçimde uzaklaşıyor ve resmi sonuca daha uzak bir hatırlama üretiyor (beceri −11,1 ve −11,9; geriye dönük 28 anketin 28'inde negatif, medyan −6,7). İkinci ankette skorun plasebo ile gerçek dağılımı ayırt ettiği de doğrulanamadı. Karar: beceri negatifse güven bandı skordan bağımsız olarak düşük; hatırlama karşılaştırması artık "doğrulama" değil teşhis olarak sunulur.
Şık sırası duyarlılığı
Parti listesi ve şema sırası her çağrıda deterministik olarak karıştırılır (konum yanlılığına karşı). İki farklı sıra tohumuyla koşulan anketler arasındaki en büyük fark 3,7 puan — gürültü tabanının altında. Karar: karıştırma açık kalır; ayrıca düzeltme yapılmaz.
Arka plan enjeksiyonu ablasyonu
Türkçe örnek davranış kalıpları ve Bourdieu habitus profili enjeksiyonlarının katkısı dört kolla ölçüldü (ikisi · hiçbiri · yalnız biri · yalnız diğeri), iki bağımsız ankette. Net katkı +0,013 ve −0,011 sadakat puanı — ikisinde de gürültünün içinde. Karar (2026-09-17): enjeksiyonlar üretimden kaldırıldı; ölçüm kolu olarak korunuyor.
Kanıt hiyerarşisi — hangi iddia nasıl destekleniyor?
| İddia | Kanıt türü | Durum |
|---|---|---|
| Ulusal toplam güncel anket ortalamasıyla tutarlı | Ölçülmüş — rake öncesi ham çıktı ile konsensüs çapası arasındaki mesafe her ankette raporlanır | Aktif |
| Küme başlangıç dağılımları YSK ile tutarlı | Örneklem-içi tutarlılık (kürleme hedefiyle aynı veri) | Aktif, bağımsız doğrulama değil |
| Yaşam tarzı segmentleri yayımlanmış saha bulgularıyla örtüşür | Ölçülmüş — Argyle sadakat skoru, 3 seçim | Aktif |
| Model hatırlama sorusunda başlangıçtan iyidir | Ölçülmüş — plasebo ve beceri skoru (başlangıç dağılımı prompt'ta verilen çapalarda) | Çürütüldü (beceri negatif) |
| Tarihsel olay tepkileri doğru tahmin edilir | Çıkarsanmış referans tablolarına karşı doğruluk; klimatoloji taban çizgisi beceri skoru — yankı odası arşivi olaylardan yeni olduğundan backtest'ler bağlamsız koşar | Kısmi — beceri skoru yeni eklendi |
| Seçim sonucu önceden tahmin edilir | Örneklem-dışı test (seçim öncesi anketin resmi sonuçla kıyası) | Henüz ölçülmedi — bir sonraki seçimde |
| Unutma eğrisi zaman sabiti Türkiye'ye uygun | Literatür varsayımı; ampirik fit diagnostiği mevcut | Varsayım |
| Model, başlangıç dağılımı ve sonucu verilmeyen bir seçimi hatırlayabilir | Ölçülmüş — her ankette bir çapa dışarıda tutulur (milletvekili: 2024 yerel, cumhurbaşkanlığı: 2018 1. tur, belediye: 2019) | Aktif — 2026-09-17'den itibaren |
| Yankı odası bağlamı dağılımı anlamlı biçimde değiştirir | Ölçülmüş — aynı ankette yankı odası olan ve olmayan kollar, gürültü tabanına göre | Ölçüm aşamasında (2026-09-17) |
Tüm ölçüm komutları ve karar tabloları ürün belgelerinde açıktır. Ölçümler tek model sabitlemesi altında geçerlidir; model parmak izi değiştiğinde yenilenir.
Akademik referanslar: Bisbee ve ark. (2024) — Synthetic Replacements for Human Survey Data? (Political Analysis); Dominguez-Olmedo, Hardt & Mendler-Dünner (2024) — Questioning the Survey Responses of Large Language Models (NeurIPS); Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling; Murphy (1988) — Skill Scores Based on the Mean Square Error (Monthly Weather Review 116:2417).
Tarihsel olay kapsamı
Kalibrasyon seti 1999'dan 2025'e uzanan elle seçilmiş olaylardan oluşur; güncel sayı aşağıda canlı hesaplanır.
150 toplam olay
Modül D (Backtest) ve Modül K (Sentetik Anket) kalibrasyonu, 1999'dan bugüne uzanan 26 yıllık politik döngüye dayanır. Şubat 2001 krizi, 2002 AKP doğuşu, 2007 e-muhtıra, 2010 anayasa referandumu, 2013 Gezi olayları, 2016 darbe girişimi, 2018 lira krizi, 2020 COVID, 2023 Kahramanmaraş depremi, 2025 İmamoğlu süreci dahil seçilmiş olaylar için 12 küme × 5 duygu (öfke, korku, apati, umut, destek) gerçek tepki dağılımı kayıtlı.
1999
Başlangıç
26 yıl
Kapsam
7
Seçim çıpası
2014 öncesi dönem, günümüz küme yapısıyla geriye yansıtılmıştır — bu olaylar "eski dönem" olarak etiketlenir. 2014 sonrası küme davranışı doğrudan ölçülmüştür. Güncel kalibrasyon bütünleşik skoru bu sayfadaki canlı panelde yayımlanır.
Önceki dönem olayları (2010 öncesi), anket arşivleri seyrek olduğundan birincil çıpa olarak seçim verilerini kullanır. 2013 sonrası olaylar, daha ayrıntılı segment bazlı gerçek ölçüm üretebilen daha zengin anket araştırmalarından yararlanır.
Referans Veri Kuralı
Kalibrasyon setindeki her olayın, olay tarihinden itibaren yaklaşık altı ay içinde nitelikli bir referans ölçümü vardır: seçim sonucu, ulusal anket veya resmî istatistik yayımı. Doğrulayıcı referansı olmayan olaylar, tarihsel önemi ne kadar büyük olursa olsun kapsam dışı bırakılır. Bu kural doğruluk skorunu şeffaf ve güvenilir tutar.
Kalibrasyon seti sürekli genişletilmektedir. Her sürümde eklenen yeni olaylar değişiklik günlüğünde belirtilir. Hedef, ikinci yılın sonuna kadar 500'ü aşkın olaydir.
Akademik referanslar: King & Lowe (2003) — Automated Information Extraction for Conflict Data (International Organization); Schrodt (2012) — Precedents, Progress & Prospects in Political Event Data (Int'l Interactions); Boschee et al. (2015) — ICEWS Coded Event Data (Harvard Dataverse); Leetaru & Schrodt (2013) — GDELT: Global Data on Events, Location and Tone.
Pazar Sinyal Profili
Karargah · Karargah+Modül K varsayılan modda 12 siyasi kümenin her biri için ayrı bir yapay zeka oturumunda küme-içi parti dağılımı üretir; ulusal tahmin bu dağılımların küme nüfus paylarıyla ağırlıklı toplamıdır. 26 NUTS-2 × 4 SES × 3 yaşam tarzı = 312 demografik hücre üzerinden örnekleme yalnızca Karargah+ planındaki hücre-düzeyi modda kullanılır. "Şu an seçim olsa ne olur?" sorusuna sentetik simülasyon bazlı bir karar destek sinyali sunar; kamuoyu yoklaması değil, stratejik iç değerlendirme aracıdır.
-
1
Küme bazlı paralel analiz
12 siyasi kümenin her biri — küme kimliği, yaşam tarzı çapası, ideoloji eksenleri ve o kümenin yankı odası anlık görüntüsü verilerek — ayrı bir oturumda değerlendirilir. Model, kümeye verilen başlangıç dağılımını yankı odasındaki canlı gündeme göre revize eder.
-
2
Hatırlama kalibrasyonu
Her kümeden 2024 yerel, 2023, 2018 ve 2015 Kasım seçimlerinin hatırlanan dağılımları da istenir; ağırlıklı ulusal toplam YSK sonuçlarıyla karşılaştırılır. Bu karşılaştırma bir düzeltici DEĞİLDİR ve 2026-08 ölçümünden bu yana tek başına güven göstergesi de sayılmaz: skorun yanında, modelin kendisine verilen başlangıç dağılımına göre ne kazandırdığını ölçen beceri (skill) değeri raporlanır ve beceri negatifse güven bandı düşük kalır. Her ankette bir çapa dışarıda tutulur: modele ne başlangıç dağılımı ne sonuç verilir; güven bandı öncelikle bu çapadan belirlenir.
-
3
Nüfus ağırlıklı ulusal birleştirme
Tüm segment çıktıları nüfus paylarıyla ağırlıklandırılarak ulusal tabloya dönüştürülür. Segment içi göreceli sıralama korunurken ulusal toplam, son 30 günde yayımlanmış en az 6 bağımsız anket firmasının trimmed-mean (uçları atılmış ortalama) konsensüsüne Yinelemeli Oransal Uyum (IPF/raking) ile hizalanır. Tarihsel seçim sonuçları yalnızca kalibrasyon kalitesinin göstergesi (recall) olarak kullanılır; tahmini geçmiş sonuçlara çekmez. Geçersiz veya eksik dönen segmentler otomatik olarak kapsam dışı tutulur.
Ulusal toplam, yayımlanmış anket ortalamalarından oluşan konsensüs çapasına yinelemeli oransal uyum (raking) ile demirlenir: küme × parti matrisinin satır yapısı (küme-içi çapraz-oran ilişkileri) korunur, yalnız sütun toplamları çapaya çekilir. Bu, anket ağırlıklandırmasındaki kalibrasyon tahmincisinin aynısıdır (Deville & Särndal 1992; Deville, Särndal & Sautory 1993). Demirlenmiş toplamın çapaya yakınlığı tanım gereği yüksektir ve model kalitesi göstergesi DEĞİLDİR; model kalitesini taşıyan sayı rake ÖNCESİ ham çıktının çapaya uzaklığıdır ve raporda ayrıca gösterilir.
7
seçim çıpası
25+
yıllık tarihsel kapsam
Kamuoyu yoklaması değildir
Modül K çıktısı kamuoyu yoklaması değildir; "sentetik simülasyon" çerçevesi ve filigranı olmadan yayımlanamaz, resmi/otoriter anket gibi sunulamaz. YSK kanunu uyarınca yaklaşan seçime 10 günden az süre kaldığında modül otomatik devre dışı kalır. Sentetik nitelik, kullanıcı tarafından her çalıştırmada onaylanır.
05.5b — Cumhurbaşkanlığı varyantı
Karargah · Karargah+CB seçimi 2-tur sentetik sinyali
Cumhurbaşkanlığı varyantı, aday-bazlı 2-tur dağılım için çalışır. 12 siyasi küme, 5 sabit aday rolü (iktidardaki aday, ana muhalefet, Kürt siyasi cephe, milliyetçi alternatif, dindar sağ) bağlamında analiz edilir. Müşteri ekipleri aday görüntü adlarını kendi seçimlerine göre özelleştirebilir.
- • R1'de %50 geçilmediyse otomatik R2 hesabı (R2 her zaman hipotetik olarak doldurulur; aggregator karar verir).
- • Kalibrasyon: 2018 R1, 2023 R1 ve 2023 R2 YSK resmî seçim sonuçları. Güncel kalibrasyon skoru bu sayfadaki canlı panelde yayımlanır.
- • 2028 aday belirsizliği gözetilerek model esnekliği korunur; müşteri ekipleri tanınan aday isimlerini sisteme girebilir.
⚠ MV anketinin tüm etik bekçi'si CB varyantında aynen geçerli: kamu CB anketi DEĞİLDİR, filigran zorunlu, T-10 yasak penceresi, PDF 30 gün expiry, recall sadece kalibrasyon.
05.5c — Yerel (Belediye) varyantı
Karargah · Karargah+Belediye başkanlığı il bazlı sentetik sinyali
Belediye başkanlığı varyantı, il bazında (NUTS-3, 81 il) yerel seçim analizi sunar. 12 ulusal siyasi küme, 6 sabit aday rolüyle (mevcut başkan, ana muhalefet, Kürt siyasi, milliyetçi alternatif, dindar sağ, bağımsız-yerel) kesiştirilir. Kümelerin ulusal ağırlıkları korunur; yapay zeka her kümenin il bağlamına özgü davranışını tahmin eder.
- • İl seçimi (plaka 01..81) zorunlu. Her prompt'a il adı, bölge, tier (büyükşehir/il) ve (varsa) anchor verisi enjekte edilir.
- • TEK TUR — yerel seçimlerde R2 yok. En yüksek geçerli oy alan aday kazanır. Marj (1.−2.) ayrıca raporlanır.
- • Kalibrasyon: 2019 + 2024 YSK yerel sonuçları (30 il YSK doğrudan, 51 il TR Wikipedia/YSK alıntısı). Tüm 81 il için kalibrasyon skoru üretilir; düşük güvenli iller config'te UNCERTAIN olarak işaretlidir.
- • İl bazlı küme payları sabit kalır; çıktı '12 küme perspektifinden il X fotoğrafı' olarak yorumlanmalıdır. Bu, yetersiz yerel veri sorununu aşmak için bilinçli bir tasarım tercihidir.
⚠ MV anketinin tüm etik bekçi'si yerel varyantta aynen geçerli: kamu yerel anketi DEĞİLDİR, filigran zorunlu, T-10 yasak penceresi, PDF 30 gün expiry, recall sadece kalibrasyon.
Akademik referanslar: Argyle et al. (2023) — Out of One, Many: Using Language Models to Simulate Human Samples (Political Analysis); Horton (2023) — Large Language Models as Simulated Economic Agents: Homo Silicus (NBER WP 31122); Bisbee et al. (2024) — Synthetic Replacements for Human Survey Data? (Political Analysis); Aher, Arriaga & Kalai (2023) — Using LLMs to Simulate Multiple Humans (ICML); Deville & Särndal (1992) — Calibration Estimators in Survey Sampling (JASA 87:376-382); Deville, Särndal & Sautory (1993) — Generalized Raking Procedures in Survey Sampling (JASA 88:1013-1020).
Bilinen sınırlamalar
VoxSim bir karar destek aracıdır, kehanet makinesi değil. Sınırlamaların açıkça aktarılması sorumlu kullanımın temelidir.
-
Sentetik ajanlar ≠ gerçek insanlar
Yanıtlar, gerçek vatandaşlardan değil istatistiksel ajanlardan gelir. Model bireysel hikayeleri, mikro-topluluk dinamiklerini veya anlık ruh hali değişimlerini yakalayamaz.
-
Kalibrasyon gecikmesi
Model parametreleri en son kalibrasyon döngüsünü yansıtır. Hızla gelişen durumlar — acil krizler, ani liderlik değişimleri — henüz yansıtılmamış olabilir.
-
Korelasyon, nedensellik değil
Yüksek öfke sinyali politikanızın bu öfkeye neden olduğu anlamına gelmez. Eş zamanlı başka faktörler tarihsel örüntüyü açıklıyor olabilir; model atıfı olaya yapar, bağlamsal dış etkenlere değil.
-
Kapsam boşlukları
1999 öncesi olayların anket çıpası yoktur ve kapsam dışıdır. Yalnızca belirli NUTS-2 bölgelerini etkileyen yerel olaylar toplu doğrulukta yetersiz temsil edilebilir.
-
LLM değişkenliği (mitigasyon: Bisbee + Atari)
Simülasyon çıktıları büyük dil modelleri tarafından üretilir ve LLM doğasındaki sınırlamaları taşır: halüsinasyon riski, prompt ifadesine duyarlılık, gerçek dünya anlayışı eksikliği. Faz 1.8'de aktif mitigasyonlar yerleştirildi — Bisbee replication sweep (N=5 σ ölçümü, bkz. 04.6), Atari WEIRD bias için Türkçe few-shot kütüphanesi (12 cluster × 3 aggregate pattern). Tek-shot çıktı hâlâ sınırlıdır; production'da unstable band tespit edilirse PDF'e uyarı gömülür.
-
Sentetik anket kamuoyu yoklaması değildir
Modül K, 12 siyasi küme üzerinde LLM tabanlı dağılım tahmini üretir; gerçek seçmenle yapılmış bir anket DEĞİLDİR ve ancak sentetik simülasyon çerçevesiyle, filigranlı olarak paylaşılabilir. Geçmiş seçim hatırlama dağılımları yalnızca teşhis göstergesidir — tahmini son seçim sonucuna çekmek için düzeltici olarak KULLANILMAZ. Yaklaşan seçimden önceki son 10 gün Modül K otomatik devre dışıdır.
-
Belediye anketinde cluster payları il bazında yerelleştirilmez
Belediye anketi varyantında 12 siyasi cluster'ın ulusal payları il bazında yeniden tahmin edilmez (küçük illerde örneklem seyrekliği riski nedeniyle bilinçli karar). İl bağlamı LLM prompt'una enjekte edilir ve model cluster içi davranışı il bağlamına göre revize eder; atipik illerde (örneğin bir cluster'ın il içindeki gerçek payının ulusal paydan çok saptığı durumlarda) bu yaklaşımın hata payı artar. 2019 + 2024 YSK anchor'larıyla il bazında kalibrasyon ölçülür; 51 il anchor'ı ikincil kaynaklardan derlenmiştir ve düşük güvenli iller config'te UNCERTAIN olarak işaretlidir.
Akademik referanslar: Bisbee et al. (2024) — Synthetic Replacements for Human Survey Data? The Perils of LLMs (Political Analysis); Santurkar et al. (2023) — Whose Opinions Do Language Models Reflect? (ICML); Park et al. (2023) — Generative Agents: Interactive Simulacra of Human Behavior (UIST); Atari et al. (2023) — Which Humans? (WEIRD bias in LLMs).
Uyumluluk ve etik çerçeve
VoxSim, AB ve Türkiye mevzuatı kapsamındaki veri koruma, yapay zeka şeffaflığı ve etik gereksinimleri göz önünde bulundurularak tasarlanmıştır.
-
EU AI Act (Yüksek Risk Sınıflandırması)
Demokratik süreçleri etkileyebilecek yapay zeka sistemleri yüksek risk kapsamındadır. VoxSim bu kapsamda şeffaf doğruluk skoru, insan gözden geçirme aşaması ve kötüye kullanım önleyici etik filtreler ile tasarlanmıştır.
-
GDPR (Genel Veri Koruma Tüzüğü)
Sistem sentetik (yapay) veri kullanır — gerçek bireysel kişisel veri içermez. Müşteri belgeleri DPA çerçevesinde işlenir. Veri saklama 12 ay; silme hakkı self-service olarak sağlanır.
-
KVKK (Kişisel Verilerin Korunması Kanunu)
Türkiye merkezli müşteriler için KVKK uyumlu veri işleme sözleşmesi uygulanır. Talivio Technology OÜ veri işleyici, müşteri ise veri sorumlusu konumundadır.
-
Sentetik veri ve gizlilik
Üretilen simülasyon çıktıları gerçek kişi veya anket katılımcılarının verisine dayandırılmaz. İstatistiksel dağılımlar (<a href="https://data.tuik.gov.tr/Kategori/GetKategori?p=nufus-ve-demografi-109" target="_blank" class="underline hover:text-navy-500">TÜİK</a> ve kamuya açık araştırmalar) toplu seviyede kullanılır.
Uyumluluk ve yasal sorular için: [email protected]
İlk simülasyonunuzu çalıştırmaya hazır mısınız?
Söylem Testi modülüyle başlayın — sonuçlar 5 dakikadan kısa sürede.