Dergiler / Nöropsikiyatri Arşivi / 2020 / Cilt: 57 - Sayı: 2

Pekiştirmeli Öğrenmede Otomatikleşme: Model Tabanlı Fonksiyonel Manyetik Rezonans Görüntüleme Çalışması

Towards Automaticity in Reinforcement Learning: A Model-Based Functional Magnetic Resonance Imaging Study

Sayfa
98–107
DOI
—

Özet

Amaç: Önceki çalışmalar, medyal prefrontal kortekste bulunan birçok nöronun öğrenme süreci boyunca ateşlemelerini tahmin edilen en yüksek değere sahip olan ödüle yönelik yaptığını, ancak daha sonraki denemeler sırasında ateşlemelerini azaltıp, striatum tarafından kontrol edilen daha otomatik bir bilgi işleme tarzına geçtiğini göstermiştir. Mevcut araştırmada önceki kanıtlara dayanarak, öğrenmenin erken dönemlerinde yapılan seçimler için önce öngörülen ödül değerinin medyal frontal korteks tarafından yürütülen hedefe yönelik bir sistem tarafından kodlandığını, fakat ilerleyen denemelerde öngörülen değerin striatum tarafından temsil edildiği hipotezinde bulunulmuştur. Yöntem: Bu çalışmada, 12 katılımcıdan her biri bir pekiştirmeli öğrenme görevi gerçekleştirirken fonksiyonel manyetik rezonans görüntüsü (fMRG) verisi toplanmıştır. Bu görev, bir katılımcının para kaybetmek veya kazanmaktan kaçınmak için mevcut iki seçenekten birini seçtiği denemelerden oluşmuştur. Buna ek olarak, katılımcılara her bir seçimden sonra para ödülü (para kazanma), para cezası (para kaybetme) veya nötr geri bildirim verilmiştir. Bulgular: Olayla ilgili fonksiyonel manyetik resonans görüntülüme (fMRG) verileri model tabanlı analiz kullanılarak, olayla ilgili bölgeler olan medyal frontal korteks, kaudat çekirdeği, putamen ve globus pallidus iç ve dış segmentlerine yapılmıştır. Beyin aktivitesindeki farklılığın erken (hedefe yönelik) ve geç öğrenme (alışılmış, otomatik) ile karşılaştırılması amacıyla her anatomik alt bölge için ayrı birer ilgili bölge istatistiksel analizi yapılmıştır. Ödül koşulu için, sadece erken öğrenme denemelerinde medyal frontal kortekste anlamlı aktivite bulunmuş (p

Abstract

Introduction: Previous studies showed that over the course of learningmany neurons in the medial prefrontal cortex adapt their firing ratetowards the options with highest predicted value reward but it wasshowed that during later learning trials the brain switches to a moreautomatic processing mode governed by the basal ganglia. Based onthis evidence, we hypothesized that during the early learning trials thepredicted values of chosen options will be coded by a goal directedsystem in the medial frontal cortex but during the late trials the predictedvalues will be coded by the habitual learning system in the dorsalstriatum.Methods: In this study, using a 3 Tesla functional magnetic resonanceimaging scanner (fMRI), blood oxygen level dependent signal (BOLD)data was collected whilst participants (N=12) performed a reinforcementlearning task. The task consisted of instrumental conditioning trialswherein each trial a participant choose one of the two available optionsin order to win or avoid losing money. In addition to that, dependingon the experimental condition, participants received either monetaryreward (gain money), monetary penalty (lose money) or neural outcome.Results: Using model-based analysis for functional magnetic resonanceimaging (fMRI) event related designs; region of interest (ROI) analysiswas performed to nucleus accumbens, medial frontal cortex, caudatenucleus, putamen and globus pallidus internal and external segments. Inorder to compare the difference in brain activity for early (goal directed)versus late learning (habitual, automatic) trials, separate ROI analyseswere performed for each anatomical sub-region. For the rewardcondition, we found significant activity in the medial frontal cortex(p