Следите за новостями по этой теме!
Подписаться на «Психология / Научные исследования»
Учёные разработали новую вычислительную модель, чтобы объяснить, почему в мозге уровень допамина медленно нарастает по мере приближения к ожидаемому вознаграждению. Ключ к разгадке — совмещение двух разных типов обучения, что позволяет мозгу быстрее пересматривать свои ожидания и разрешает старую загадку нейронауки. Результаты опубликованы в журнале eLife.
Допамин — химическое вещество, связанное с обучением, мотивацией и движением. Долгие годы считалось, что допамин сигнализирует об ошибке прогноза награды: если животное получает неожиданный приз, допаминовые нейроны активируются и таким образом «говорят» мозгу, что ожидания пора пересмотреть. Эта информация сохраняется в стриатуме — отделе головного мозга. Как только процесс стал полностью предсказуемым, ошибки прогноза должны исчезать.
Однако исследования с измерением допамина во время задач с перемещением показали загадочный феномен: по мере приближения животного к известной награде уровень допамина плавно увеличивается, словно она не предсказуема вовсе. Классические модели не могут объяснить, почему ошибка прогноза продолжает расти там, где ей, казалось бы, расти не с чего.
Люк Пристли и Томас Акам из Оксфордского университета попытались устранить это противоречие, разработав компьютерную модель с двумя процессами обучения. Первый — медленный, основан на запоминании и хранится в базальных ганглиях. Второй — быстрый, гибко и прямо на ходу строит карту ценностей на основе внутренней модели окружающего мира (вероятно, за неё ответственна фронтальная кора).
В этой схеме при обновлении ожиданий мозг сравнивает текущий прогноз (от медленной системы) с «обновлённой целью» (рассчитанной быстрым процессом). Поскольку быстрый процесс заранее предчувствует близость награды, разрыв между актуальной целью и отставшим прогнозом увеличивается по мере приближения к цели, а это и вызывает плавный рост допамина.
Модель Пристли и Акама проверили на симулированной задаче: виртуальное животное двигалось по прямой дорожке за наградой. Их двухпроцессная модель училась быстрее обычной и в точности воспроизводила тот самый подъём допамина, которого не было в классических моделях.
Когда же виртуальная мышь училась различать большие и маленькие награды, характерный подъём допамина постепенно исчезал по мере накопления опыта — как это наблюдается у реальных животных. Так подтверждалось: когда медленная и быстрая системы полностью согласуются, допаминовая «горка» уходит.
В новых и незнакомых лабиринтах у реальных животных подъём допамина появляется с первых успешных попыток. У виртуальных агентов это воспроизвелось: быстрая система быстро формирует внутреннюю карту и меняет прогнозы.
Тестировали модель и на ситуации с множеством путей к одной цели — и тут быстрый мозг мгновенно перестраивает допаминовый профиль на всех дорожках, если награду меняют в одной точке.
Дополнительно моделировали типичные для экспериментов с мышами внезапные «телепорты» или изменение скорости движения: скачки и уклоны кривой допамина совпали с живыми измерениями.
При моделировании ситуации, когда виртуальная мышь неуверенно ориентируется (например, свет вокруг гаснет), подъём заменяли своеобразные «горбики» допамина — как и у настоящих животных: чем плохая видимость, тем сложнее быстро и верно прогнозировать награду.
Всё же модель работает с некоторыми допущениями. Например, быстрый модуль всегда ищет кратчайший путь, не учитывая дальнейшее поведение. Да и баланс между подсистемами в биологическом мозге, скорее всего, регулируется динамически, а не фиксирован. Модель также предполагает, что информация о расстояниях уже загружена в «мозг» агента, хотя у животных эта навигация развивается постепенно.
В будущем учёные планируют проверить, как именно быстрый мозговой модуль влияет на участки, скрывающие эти допаминовые сюрпризы, и подтверждается ли эта теория, если временно «отключить» части мозга экспериментально. Если удастся найти физические связи между этими подсистемами, это всерьёз изменит наше понимание, где заканчивается сознательное планирование и начинается автоматическая привычка.
Авторы работы: Люк Пристли и Томас Акам.
Учёные из Оксфорда куда уместнее выглядят не в лаборатории, а у стенда с головоломками: то, что допамин — не только очкарик-математик, но и шеф-повар настроения, они доказали дерзко и с циничной холодностью. Годами нам пудрили мозги: ошибся — получи заряд счастья; не ошибся — живи как жил. Но крысиная душа оказалась хитрее: неважно, насколько предсказуем приз, мозг всё равно начинает разогреваться, как старый чайник на плитке.
Теперь же у нейрофизиологов две версии мозга: одна работает по принципу «раз в жизни ошибся — и хватит», вторая играет на опережение любого результата. Эти две субличности внутри черепа устраивают перетягивание каната, а мы ощущаем результат в субъективном желании «ещё немного — и точно получу». Прямо как любители лотерейных билетов на кассе. Виртуальные мыши на симуляторах учатся, крутятся, гибко реагируют на весь этот цирк с наградами, а реальные до сих пор не понимают, кто из невидимых актёров отдаёт приказ смеяться или плакать.
Авторы скромно добавляют: настоящая крыса сложнее цифровой и на кухне у неё нет ни одного «быстрого вычислительного центра». Главное, чтобы экспериментаторы не слишком разыгрывались в телепорты и регулировку освещения — крысиные горки могут дать сбой. Хотя и нам не стоит спешить радоваться новым моделям: каждый новый прогноз — очередной повод для высокоинтеллектуальных догадок и странных диагнозов.