Монджо глубокое подкрепление изучение Александра Зай -флаг. Появленный Тайвань, подлинная оригинальная традиционная китайская импортная книга

Вес товара: ~0.7 кг. Указан усредненный вес, который может отличаться от фактического. Не включен в цену, оплачивается при получении.
Описание товара
- Информация о товаре
- Фотографии
Глубокое улучшение обучения
Глубокое обучение подкреплению в действии/1 -е издание
Подробности
Автор: Александр Зай, Брэндон Браун
Переводчик: Хуан Джун
Издательство: баннер
Дата публикации: 2021/04/02
Язык: традиционный китайский
ISBN: 9789863126522
Серия серии: обучение, делая
Технические характеристики: Pacific / 504 страницы / 17 x 23 x 2,5 см / обычная оценка / монохромная печать / начальная версия
краткое введение
Глубокое обучение подкреплению (DRL) - это технология, которая сочетает в себе глубокое обучение с расширенным обучением.Чтобы позволить AI Applications Land, DRL является незаменимой технологией.В последнее время команда Wayve, возглавляемая двумя врачами Кембриджского университета, использовала технологию DRL для разработки технологии автономного вождения, которая может учиться в новой среде, чтобы заменить практику полностью зависит от датчика.Кроме того, автоматизированный робот на фабрике, или Альфаго, который побеждает короля мира, также тесно связан с DRL.
Тем не менее, алгоритм DRL ослепитель.Фактически, они представляют собой улучшенные версии, разработанные, чтобы справиться с различными задачами.Поэтому эта книга проведет много места. к различным задачам или проблемам.
Эта книга разделена на две главы: основные и продвинутые главы.В основной главе читатели узнают, как с нуля, создавать свой первый алгоритм RL и использовать этот алгоритм для решения проблемы многооруженной гегемонии.Затем читатели будут знать более классические алгоритмы в RL, такие как DQN, метод стратегического градиента, A2C и т. Д.В то же время каждая глава соответствует нескольким проектам, чтобы убедиться, что читатели могут развивать способность реализовать актерские алгоритмы в процессе теории обучения.
В передовых статьях автор представит более новые и более сложные алгоритмы RL.По сути, эти алгоритмы используют DQN в качестве отправной точки, а также специальные навыки, вы можете решить реальные проблемы в действительности.Например, используя средний полевой DQN, ученые успешно смоделировали вращение электроники, а затем решили много -агентную проблему в RL.В то же время читатели также узнают, как комбинировать механизм применения с DQN, а затем составлять корреляцию DQN (Relational DQN) для улучшения интерпретации алгоритма.
Эта книга обеспечивает полную структуру обучения и постепенно вводит различные алгоритмы, в том числе:
● Глубокая Q-сеть (DQN)
● Методы градиента политики
● Актеры-критические
● Одноразовое преимущество ценности актеров-критиков
● Эволюционный алгоритм (эволюционный алгоритм)
● Дифференциал DQN (Distributional DQN)
● Рядом с Q-обучением (окрестности Q-обучения)
● Среднее Q-обучение (среднее поле Q-обучения)
● Связанный DQN (Relational DQN)
В дополнение к алгоритму, связанному с RL, книга также представляет популярную модель, разработанную недавним приложением RL.
● Графическая нейронная сеть (GNN)
● Модель трансформатора
● Модель внимания
В целом, эта книга является наиболее полным и народным улучшенным алгоритмом обучения.Пока у вас есть базовые знания о глубоком обучении и хотите знать область улучшенного обучения, то вы являетесь подходящим читателем для этой книги!
Характеристика
● Включая фундамент и передовый алгоритм различного усиленного обучения, структура обучения завершена
● Правильно дополнять основу математики и статистики и непосредственно рассмотреть необходимые знания.
● Сосредоточьтесь на основной архитектуре обучения глубоким подкреплением и понимать основу и модель улучшения улучшения.
● Практикуйте DRL в ежедневных случаях и больше понимайте с меньшими усилиями
● Используйте Python+Pytorch для реализации различных проектов главах, не просто расскажет о солдатах на бумаге
● Все программы были отсортированы в ноутбуках Colab, и результаты можно проверить за один щелчок
● Эта книга контролируется исследовательским отделом Ши Вайминга.
об авторе
об авторе
Alex Zai
Алекс Зай был главным техническим специалистом Codesmith (Codesmith - это захватывающий буткемп, Алекс по -прежнему является техническим консультантом сегодня), программист Uber, а также банджо и инженеры по машинному обучению Amazon.Он также является одним из участников архитектуры глубокого обучения с открытым исходным кодом Apache Mxnet.Алекс Зай также является предпринимателем, который основал две компании, одну из дочерних компаний Y-комбинентатора.
Brandon Brown
Брэндон Браун изучал дизайн программирования и работал инженером -программистом во время колледжа, но в конце концов он решил войти в медицинскую индустрию.В настоящее время он все еще занимается разработкой программного обеспечения в области медицинских технологий.Брэндон в настоящее время является врачом и занимается исследованиями, связанными с вычислительным психологическим (эта область вдохновлена DRL).
Оглавление
Глава 1: Основная статья
Глава 1: Основная концепция укрепления обучения
1.1 глубокое обучение "глубина"
12 Укрепление обучения
1.3 Динамический план против Монгольской Карольфы
1.4 Архитектура подкрепления обучения
Каковы применение укрепления улучшенного обучения?
1.6 Зачем использовать «глубокое» улучшенное обучение?
1.7 Полезный инструмент объяснения–Строковая диаграмма (строковая диаграмма)
1.8 Аранжировка содержания каждой главы в будущем
Глава 2: Моделирование подкрепления Вопрос обучения: процесс принятия решений Маркофу
2.1 Проблема с мульти -армией гегемонии
2.2 Используйте алгоритм Ратагона для оптимизации стратегии рекламного толкания
2.3 Построить нейронную сеть с помощью pytorch
2.4 Решите проблему рекламного толчка
2.5 Marcov Nature и MDP (процесс принятия решений MARCO)
2.6 Функция стратегии и стоимости
Глава 3: Глубокая Q-сеть
3.1 Функция значения состояния и функция значения действия
3.2 Используйте Q-обучение для изучения
3.3 Избегайте катастрофической амнезии: воспроизведение опыта
3.4 Используйте целевую сеть для повышения стабильности обучения
3.5 Обзор
Глава 4: Используйте «метод градиента стратегии», чтобы выбрать лучшую стратегию
4.1 Используйте функцию стратегической функции нейронной сети
4.2 Алгоритм стратегического градиента: укрепление действия высокого значения
4.3 Используйте тренажерный зал Openai
4.4 Усиление алгоритма
Глава 5: Модель актер-критической и децентрализованной подготовки
5.1 в сочетании с «функцией значения» и «Функцией стратегии»
5.2 Специальное обучение
5.3 Совместные модели актеров-критиков
5.4 n актер-критическая
Глава 2: Входная глава
Глава 6: Алгоритм эволюции
6.1 Недостатки алгоритма снижения градиента
6.2 Используйте стратегию эволюции для реализации обучения подкреплению
6.3 Играйте в Cartpole с генетическим алгоритмом
6.4 Преимущества и недостатки алгоритма эволюции
6.5 Алгоритм эволюции может быть «скорректирован»
Глава 7: Дифференциал DQN
7.1 Страхование Q-обучения экспресс.
7.2 шансы и статистика
7.3 Формула Беллмана
7.4 Выделенное Q-обучение
7.5 Распределение скорости сравнения
7.6 Используйте Dist-DQN для обработки информации о моделировании
7.7 Игра в автостраде
Глава 8: Развивайте любопытство агента
8.1 Прогнозируемая модель энкодера
8.2 Обратный динамический прогноз
8.3 Установите игру Mario
8.4 Обработка оригинальной информации о состоянии игры
8.5 Установите функции сети и стратегии Q и стратегии
8.6 Модуль внутреннего любопытства (ICM)
8.7 Еще один механизм значения внутренней обратной связи
Глава 9: Среда мульти -агента
9.1 Взаимодействие между несколькими агентами
9.2 Рядом с Q-обучением
9.3 1d Ising Model
9,4 Среднее Q-обучение
9.5 Игры, содержащие отношения между «соревнованиями» и «сотрудничеством»
Глава 10: Объясненная модель: модели внимания и ассоциации
10.1 Рисунок Нейронная сеть
10.2 Связанные рассуждения на основе внимания
10.3 Используйте самооценку для обработки набора данных MNIST
10.4 Внимание и Ассоциация DQN Multi -Port
10.5 двойной Q-обучение
10.6 Результаты обучения и визуализации
Глава 11: Планирование обзора и обучения
11.1 Оглядываясь назад на процесс обучения
11.2 в вопросах обучения на глупости, которые необходимо изучить
11.3 Заключение
Глава A: Математика, глубокое обучение и экстремальное дополнение знаний Pytorch
A.1 Линейная алгебра
A.2 Calculus
A.3 В -DEPTH Learning
A.4 PyTorch



