满分代码百度网盘下载链接:

通过网盘分享的文件:智能计算系统_实验5_2.zip
链接: https://pan.baidu.com/s/1RpIO80aZpmkZ6bTQZ1p0Xg?pwd=e6kw 提取码: e6kw

v3.0-实验5-2-智能编程语言性能优化实验-v5_mul

1. 实验目的

   

    掌握使用智能编程语言优化算法性能的原理,掌握智能编程语言的调试和调优方法,能够使用智能编程语言在MLU上加速矩阵乘的计算。

    实验工作量:代码量约700行,实验时间约6小时。

2. 实验环境

   本章实验基于 DLP 云平台环境。其中有 DLP 的硬件平台和相应的软件环境。

   

3. 实验内容和步骤

   详情请查看实验指导书

4. 评分标准

本实验设定的评估标准如下,每升高一级标准,不但要实现当前分值标准的代码,还要实现上一级分值标准的代码,即100分标准要求实现“标量NRAM实现”、“向量NRAM实现”、“多核向量NRAM实现”、“多核向量NRAM三级流水实现”、“多核向量SRAM五级流水实现”共5个版本的BANG C代码。

•60分标准:MxNxK = 128x256x128规模,实现标量NRAM矩阵乘,MLU计算结果与CPU计算结果误差为0。
•70分标准:MxNxK = 128x256x128规模,实现向量NRAM矩阵乘,精度达标,MLU性能为CPU的xxx倍以上。
•80分标准:MxNxK = 524288x256x128规模,实现多核向量NRAM矩阵乘,精度达标,MLU性能为CPU的xxx倍以上。
•90分标准:MxNxK = 524288x256x128规模,实现多核向量NRAM三级流水矩阵乘,精度达标,MLU性能为CPU的xxx倍以上。
•100分标准:MxNxK = 524288x256x128规模,实现多核向量NRAM五级流水矩阵乘,精度达标,性能和三级流水在同一个数量级。

5. 文件提交格式

    需要提交的文件为 01_scalar.mlu、02_scalar_nram.mlu、03_vector_nram.mlu、04_vector_nram_blocks.mlu、05_vector_nram_blocks_pip3.mlu、06_vector_sram_unions_pip5.mlu,将上述文件直接打包为 zip 文件提交。


提交源文件 , 只能提交以 rar、zip 为后缀的文件

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐