4.1 Cuda Thread Organization4.2 Mapping Threads to Multidimensional Data4.3 Matrix-Matrix Multiplication—A More Complex Kernel4.4 Synchronization and Transparent Scalability4.5 Assigning Resources to Blocks4.6 Querying Device Properties4.7 Thread Scheduling and Latency Tolerance4.8 Summary4.9 Exercises