8 (905) 200-03-37 Владивосток
с 09:00 до 19:00

Cuda Parallel Design Shane Cook Works Su Tonghua и другие программы переводчиков (новые) Профессиональные технологии Синьхуа

Цена: 1 471руб.    (¥69.59)
Артикул: 558141001670

Вес товара: ~0.7 кг. Указан усредненный вес, который может отличаться от фактического. Не включен в цену, оплачивается при получении.

Этот товар на Таобао Описание товара
Продавец:数字图书专营店
Рейтинг:
Всего отзывов:0
Положительных:0
Добавить в корзину
Другие товары этого продавца
¥3467 287руб.
¥24.1510руб.
¥59.21 251руб.
¥169.73 586руб.

Cuda Parallel Designs

делать  К:Работы Шейна Кука от Су Тонхуа и т. Д. Переводчик
Конечно  цена:99
Издательское агентство:Машиностроительная промышленность Пресса
Дата публикации:01 января 2014 г.
Страница  число:522
Пакет  рамка:Оплата в мягкой обложке
ISBN:9787111448617
Оглавление
Китайский читатель
Переводчик
раньше  слова
Глава 1  Краткая история суперкомпьютирования 1
1.1 Введение 1
1.2 Фон Неймана Компьютерная архитектура 2
1,3 глина 4
1.4 Подключающая машина 5
1.5  Клеточный процессор 6
1.6 Многоточечные вычисления 8
1.7 Раннее программирование GPGPU 10
1.8 Смерть одноядерных решений 11
1,9 nvidia и cuda 12
1.10 ОБОРУДОВАНИЕ ГПУ 13
1.11 Альтернативные варианты для CUDA 15
1.11.1  OpenCL 15
1.11.2 DirectCompute 16
1.11.3 Альтернативные варианты для ЦП 16
1.11.4 Скомпиляционные директивы и библиотеки 17
1.12 Резюме этой главы 18
Глава 2  Понимание параллельных вычислений с использованием графического процессора 19
2.1 ВВЕДЕНИЕ 19
2.2 Традиционный серийный код 19
2.3 Серийный/параллельный выпуск 21
2.4 Согласно 22
2,5 типа параллельной обработки 25
2.5.1 Параллельная обработка на основе задач 25
2.5.2 Параллельная обработка на основе данных 27
2.6 Классификация Флинна 29
2.7 Обычно используется параллельный режим 30
2.7.1 Режим на основе петли 30
2.7.2 Режим вывода/агрегации 31
2.7.3 Срезы/блоки 33
2.7.4 Разделение и завоевание 34
2.8 Резюме этой главы 34
Глава 3  Обзор оборудования CUDA 35
3.1 Архитектура ПК 35
3.2 Аппаратная структура GPU 39
3.3 CPU и GPU 41
3.4 GPU Computing Power 42
3.4.1 Вычислительные возможности 1.0 42
3.4.2 Вычислительные возможности 1.1 43
3.4.3 Вычислительные возможности 1.2 44
3.4.4 Вычислительные возможности 1.3 44
3.4.5 Вычислительная мощность 2.0 44
3.4.6 Вычислительные возможности 2.1 46
Глава 4  Cuda Environment Construction 48
4.1 Введение 48
4.2 Установка комплекта разработки программного обеспечения под Windows 48
4.3 Visual Studio 49
4.3.1 Проект 49
4.3.2 64 Пользователи 49
4.3.3 Создание проекта 51
4.4 Linux 52
4.5 Mac 55
4.6 Установка отладчика 56
4.7 СОЗДАНИЕ МОДЕЛЬ 58
4.8 Обработка ошибок 59
4.9 Резюме этой главы 60
Глава 5  Сетка резьбы, блоки и потоки резьбы 61
5.1  Введение 61
5.2  Тема 61
5.2.1  Проблема разложение 62
5.2.2  Разница между процессором и графическим процессором 63
5.2.3  Режим выполнения задачи 64
5.2.4  Поток графического процессора 64
5.2.5  Первый взгляд на оборудование 66
5.2.6  CUDA ядра 69
5.3  Блок 70
5.4  Сетка нить 74
5.4.1  SPAN и OFFSET 76
5.4.2  Индекс потока в направлениях x и y 77
5.5  Пакет резьбы 83
5.5.1  Филиал 83
5.5.2  Уровень использования графических процессоров 85
5.6  Планирование блоков резьбы 88
5.7  Пример - Статистическая гистограмма 89
5.8  Резюме этой главы 96
Глава 6  Обработка памяти CUDA 99
6.1  Введение 99
6.2  Кэш 100
6.3  Зарегистрируйте использование 103
6.4  Общая память 112
6.4.1  Сортировать с использованием общей памяти 113
6.4.2  Cardinality Sort 117
6.4.3  Список слияний 123
6.4.4  Параллельное слияние 128
6.4.5  Параллельное сокращение 131
6.4.6  Гибридный алгоритм 134
6.4.7  Общая память на разных графических процессорах 138
6.4.8  Общее резюме памяти 139
6.5  Постоянная память 140
6.5.1  Постоянный кеш памяти 140
6.5.2  Механизм трансляции постоянного памяти 142
6.5.3  Постоянные обновления памяти выполняются во время выполнения 152
6.6  Глобальная память 157
6.6.1  Табло 165
6.6.2  Глобальная память сортировка 165
6.6.3  Образец сортировки 168
6.7  Текстурная память 188
6.7.1  Кэш текстуры 188
6.7.2  Операция по сбору памяти на основе оборудования 189
6.7.3  190 Использование текстуры
6.8  Резюме этой главы 190
Глава 7  Практика CUDA 191
7.1  Введение 191
7.2  Серийное и параллельное кодирование 191
7.2.1  Цели процессора и графического процессора 191
7.2.2  Сравнение хороших алгоритмов на процессоре и GPU 194
7.3  Обработка данных 197
7.4  Анализ производительности 206
7.5  Пример с использованием AES 218
7.5.1  Алгоритм 219
7.5.2  Серийная реализация AES 223
7.5.3  Начальная функция ядра 224
7.5.4  Производительность функции ядра 229
7.5.5  Производительность передачи 233
7.5.6  Версия 234 в одиночном исполнении версии 234
7.5.7  Как сравнить с процессором 235
7.5.8  Рассмотрим работу на других графических процессорах 244
7.5.9  Использование нескольких потоков 248
7.5.10  AES Резюме 249
7.6  Эта глава - саммит 249
Глава 8  Решения Multi-CPU и Multi-GPU 252
8.1  Введение 252
8.2  Местность 252
8.3  Система Multi-CPU 252
8.4  Система с мульти-GPU 253
8.5  Алгоритм мульти-GPU 254
8.6  Выберите GPU 255 по требованию
8.7  Система одиночной узлы 258
8.8  Поток 259
8.9  Многоцелевая система 273
8.10  Эта глава - саммит 284
Глава 9  Оптимизация производительности приложения 286
9.1  Стратегия 1: Проблема разложение параллельного/последовательного на графическом процессоре/ЦП 286
9.1.1  Анализ проблемы 286
9.1.2  Время 286
9.1.3  Проблема разложение 288
9.1.4  Зависимость 289
9.1.5  Размер набора данных 292
9.1.6  Резолюция 293
9.1.7  Определите узкие места 294
9.1.8  Задача процессора и графического процессора 297
9.1.9  Резюме этого раздела 299
9.2  Стратегия 2: Фактор памяти 299
9.2.1  Пропускная способность памяти 299
9.2.2  Источник 300
9.2.3  Организация памяти 302
9.2.4  Доступ к памяти к рассчитанию 303
9.2.5  Петля Fusion и Fernel Fusion 308
9.2.6  Общее использование памяти и кэша 309
9.2.7  Резюме этого раздела 311
9.3  Политика 3: Передача 311
9.3.1  Замножение память 311
9.3.2  Zero Copy Memory 315
9.3.3  Пропускная способность 322
9.3.4  Графическое время 327
9.3.5  Перекрывающаяся передача графического процессора 330
9.3.6  Резюме этого раздела 334
9.4  Стратегия 4: Использование потока, вычисление и филиал 335
9.4.1  Режим памяти потока 335
9.4.2  Неактивная нить 337
9.4.3  Арифметическая плотность 338
9.4.4  Некоторые общие оптимизации компилятора 342
9.4.5  Филиал 347
9.4.6  Понимание базового кода сборки 351
9.4.7  Зарегистрируйте использование 355
9.4.8  Резюме этого раздела 357
9.5  Стратегия 5: Алгоритм 357
9.5.1  Сортировка на 358
9.5.2  Отказ 363
9.5.3  Резюме этого раздела 384
9.6  Стратегия 6: Конкурс ресурсов 384
9.6.1  Определите узкие места 384
9.6.2  Проанализируйте узкое место 396
9.6.3  Резюме этого раздела 403
9.7  Стратегия 7: Приложение для самостоятельной настройки 403
9.7.1  Определите оборудование 404
9.7.2  Использование оборудования 405
9.7.3  Производительная выборка 407
9.7.4  Резюме этого раздела 407
9.8  Эта глава - саммит 408
Глава 10  Функциональная библиотека и SDK 410
10.1  Введение 410
10.2  Функциональная библиотека 410
10.2.1  Функциональная библиотека Общая спецификация 411
10.2.2  NPP 411
10.2.3  Thrust 419
10.2.4  CuRAND 434
10.2.5  Библиотека CUBLAS 438
10.3  CUDA Computing SDK 442
10.3.1  Запрос оборудования 443
10.3.2  Тест полосы пропускания 445
10.3.3  SimpleP2P 446
10.3.4  Asyncapi и Cudaopenmp 448
10.3.5  Выравнивание типа 455
10.4  Программирование на основе инструкций 457
10.5  Напишите свой собственный ядро ​​464
10.6  Резюме этой главы 466
Глава 11  Планирование аппаратной системы GPU 467
11.1  Введение 467
11.2  Процессор процессора 469
11.3  Устройство графического процессора 470
11.3.1  Поддержка памяти большой емкости 471
11.3.2  ECC Memory Support 471
11.3.3  Tesla Compute Cluster Driver 471
11.3.4  Более высокая двойная точность математическая операция 472
11.3.5  Большая пропускная способность шины в памяти 472
11.3.6  Управление системой прерывание 472
11.3.7  Индикатор состояния 472
11.4  PCI-E Bus 472
11.5  Карта GeForce 473
11.6  Память процессора 474
11.7  Воздушное охлаждение 475
11.8  Жидкое охлаждение 477
11.9  Шасси и материнская плата 479
11.10  Хранение большой емкости 481
11.10.1  Интерфейс ввода/вывода на материнской плате 481
11.10.2  Выделенный контроллер RAID 481
11.10.3  HDSL 483
11.10.4  Требования к хранению большой емкости 483
11.10.5  Интернет подключение 483
11.11  Выбор питания 484
11.12  Операционная система 487
11.12.1  Windows 487
11.12.2  Linux 488
11.13  Резюме этой главы 488
Глава 12  Часто задаваемые вопросы, причины и решения 489
12.1  Введение 489
12.2  Ошибка инструкции CUDA 489
12.2.1  Обработка ошибок CUDA 489
12.2.2  Запуск ядра и проверка границ 490
12.2.3  Неверная работа устройства 491
12.2.4  нестабильный квалификатор 492
12.2.5  Функция зависимости вычислительной мощности 494
12.2.6  Функции устройства, глобальные функции и функции хоста 495
12.2.7  Поток в ядре 496
12.3  Проблема параллельного программирования 497
12.3.1  Конкурентное приключение 497
12.3.2  Синхронизация 498
12.3.3  Атомная операция 502
12.4  Алгоритм задача 504
12.4.1  Сравнительный тест 504
12.4.2  Утечка памяти 506
12.4.3  Труто-потребляемая программа ядра 506
12.5  Найдите и избегайте ошибок 507
12.5.1  Сколько ошибок у вашей программы GPU? 507
12.5.2  Разделите и завоевание 508
12.5.3  Утверждение и защитное программирование 509
12.5.4  Уровень отладки и печать 511
12.5.5  Управление версией 514
12.6  Развитие для будущих графических процессоров 515
12.6.1  Кеплер архитектура 515
12.6.2  Мышление 518
12.7  Последующие учебные ресурсы 519
12.7.1  Введение 519
12.7.2  Онлайн курсы 519
12.7.3  Учебные курсы 520
12.7.4  Книги 521
12.7.5  Сертификация NVIDIA CUDA 521
12.8  Резюме этой главы 522
Пунктирное содержание

краткое введение

Эта книга является одной из самых полных, подробных и авторитетных работ в области параллельного программирования CUDA. Он был написан техническим директором сообщества разработчиков CUDA и переведен первой партией официальных инженеров CUDA Nvidia China China. Он объясняет точки технических знаний (платформа, архитектура, оборудование, инструменты разработки и технологии горячих точек) и методы программирования параллельного программирования CUDA. Он содержит большое количество практических примеров кода и очень практично.
Книга разделена на 12 глав.Глава 1: Введение в историю эволюции потоковых процессоров с точки зрения макроса.Глава 2 подробно объясняет механизм параллелизма GPU и глубоко понимает последовательные и параллельные программы для диалектического решения проблем.Глава 3 объясняет оборудование CUDA и соответствующие аппаратные и архитектуры для достижения отличной производительности программы CUDA.Глава 4 представляет конструкцию среды развития CUDA и доступную среду отладки.Глава 5 представляет основные концепции, тесно связанные с программированием CUDA - сеткой, блоком потока и потоком, и использует примеры, чтобы проиллюстрировать взаимосвязь между моделью потока и производительностью.В главе 6 используются примеры для объяснения рабочих механизмов различных типов памяти, и указывают на недопонимание, которые склонны происходить на практике.Глава 7 подробно описывает сотрудничество с многозадачностью в процессоре и графическом процессоре и вводит несколько секретов программирования процессора/графического процессора.Глава 8 Введение ...

об авторе

Работы Шейна Кука от Су Тонхуа и т. Д. Переводчик

Shane Cook  Технический директор CUDA Developer Community, с более чем 20 -летним опытом работы в отрасли.При признании революционного воздействия гетерогенных систем и CUDA на технологии последовательных и параллельных программ, было основано сообщество разработчиков CUDA (европейская консалтинговая компания, которая специализируется на оказании помощи предприятиям кода рефакторов, чтобы в полной мере воспользоваться властью оборудования графического процессора).Он фокусируется на высокопроизводительной разработке программного обеспечения, использовании графических процессоров и встроенных системах, и участвовал в построении многочисленных стандартов программирования языка C, включая Misra Safer C, программное обеспечение для автомобильной промышленности, широко используемое в индустрии автомобильного программного обеспечения.Он часто предоставляет профессиональные консалтинговые услуги и разработку настройки программного обеспечения для таких учреждений, как немецкая автомобильная промышленность, оборонная индустрия контрактов, Nortel Networks, Ford Motor Company или компании Blue Chip.

Су Тонхуа  Доктор, первый офицер CUDA в Китае ...