Skip to content

【2026夏季训练营】Hadamard CUDA 加速与 INT4 融合 - #69

Open
a962695448-rgb wants to merge 2 commits into
InfiniTensor:2026-summer-projectfrom
a962695448-rgb:submit-hadamard-cuda-20260916
Open

a962695448-rgb wants to merge 2 commits into
InfiniTensor:2026-summer-projectfrom
a962695448-rgb:submit-hadamard-cuda-20260916

Conversation

@a962695448-rgb

@a962695448-rgb a962695448-rgb commented Sep 16, 2026

Copy link
Copy Markdown

提交 2026 夏季训练营第三题 Hadamard 变换加速项目,代码位于 03_hadamard_tc/a962695448-rgb/。

实现

  • NVIDIA CUDA 普通基线、warp 寄存器实现、WMMA Tensor Core 对照及分步/融合 INT4;支持 FP16/BF16 和 dim=1~256 的二次幂。
  • PyTorch 前向接口及显式线程/布局选项,保留公开 dtype 舍入、最近偶数取整和打包约定。
  • 天数、沐曦、壁仞、昇腾和摩尔五种国产平台的独立构建与验证入口。

提交与既有验证

该 PR 保留核心实现、测试与验收文档。2,586 份历史 results 文件保留在固定完整档案,通过链接引用。原有 51 份源码和构建文件与该档案字节一致;本轮新增的执行上下文验证脚本在清单中单独记录。

  • CPU reference、摩尔离线复算与原提交文档链接检查通过。
  • NVIDIA A100/4090:1,876 组 CLI 矩阵的多种模式、1,800 组固定 Dao 对照及接口/stream/偏移检查,版本和正负例见既有报告。
  • 摩尔:1,504 组完整输入、192 项 API、14 项 CLI;2,074,568 项 GPU 量化原语对照零差异。三轮 6,750 条同设备配对计时中,默认融合相对上一版为 2.012~2.898×。
  • 其他国产平台的设备、SDK、正确性和本机性能结果分别记录;跨设备测试不累计成更多独立用例。

2026-09-16 RTX 4090 路由候选实验

对提交 4049323 与一个仅减少主机端元数据/设备查询的候选做同机对照:

CPU 路由对照:21,420 组通过,其中 10,472 组匹配拒绝行为
GPU 正确性:696 组配置通过,12 类异常输入检查通过
配对计时:3 个独立进程轮次,共 3,456 条原始记录
结果:REJECTED,候选不进入本 PR 的计算源码

预先固定的保留门槛是:每轮目标配置耗时下降至少 5%,任何目标/对照配置回退不超过 2%。三轮目标耗时下降分别为 -1.1455%、-0.0448%、+0.6025%,均未达到门槛,因此保留现有实现。

固定实验档案包含原始数据、候选源码、固定协议、验证/分析脚本和取源工具。11 份原始结果回收后逐份 SHA-256 核对通过,本地复算与服务器结果一致。

这里测量带输出分配的普通 Python 接口墙钟时间,目标统计量是未加权几何平均耗时比换算的下降率;不是 kernel event、CUDA Graph 或模型端到端性能。新旧互比和重复计时不扩大独立用例数量;慢例与未采用的候选均保留。

2026-09-16 RTX 4090 D 执行上下文补测

新增测试覆盖三种接口、FP16/BF16、128/256 线程、2D/4D、维度 1/8/64/256,以及合法的 original/auto/packed/contiguous256 组合:

120 组配置全部通过
120 次非默认流检查与独立 NumPy 参考逐位一致
480 次变更输入后的 CUDA Graph 重放通过,输入保持不变
240 个错误对照全部检出:默认流消费者 120 个,旧输出 120 个

错误对照未被识别即整次失败,重放和错误对照不累计成更多独立配置。计算内核未变;这是单卡正确性补测,不宣称性能提升或新 A100 验证。

补充验收说明提供复现入口;固定原始证据保存逐项结果、负例、源码指纹和环境。

保留核心实现、必要测试、五种国产平台入口、报告及摩尔可再生成的复现材料。
将 2586 份历史 results 记录改为固定归档链接,新增快速开始、证据索引与源码清单。
保留的 51 份源码和构建文件与完整归档字节一致。

CPU reference 检查通过;摩尔 6750 条计时复算及 6 项数据完整性检查通过。
本次仅做提交整理,没有修改 GPU 计算源码或重新运行 GPU 实验。
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant