【信息科学与工程学】计算机科学与自动化—— 第一百五十五篇 C/C++高性能开发01 编号类型C/C++开发语言版本软件版本及编译器领域问题问题的数学分析及优化内容与优化效果算法的数学分析及代码分析及参数列表关联知识1矩阵乘法 SIMD+循环分块C++17GCC 11.2, -O3 -mavx2 -mfma数值计算 / 线性代数大规模矩阵乘法(M×K × K×N)计算效率低,CPU资源利用率不足数学分析:标准三重循环复杂度 O(MKN),内存访问不连续导致缓存缺失严重。通过循环分块(tiling)将子块放入 L1/L2 缓存,再利用 AVX2 FMA 指令一次完成 8 次乘加。优化内容:1. 分块大小 B=64(适配 32KB L1 数据缓存)2. 内层循环使用_mm256_fmadd_pd进行 4 个双精度浮点的融合乘加3. 对 A 矩阵