请现场实现一个CUDA向量求和(Vector Sum)的核函数与调用代码,并说明主线程与设备端的分工。
考察说明
考察CUDA核函数编写、内存模型与性能边界意识
回答思路
- 写出正确的核函数签名、索引计算与累加逻辑
- 正确使用cudaMalloc/cudaMemcpy并释放内存
- 说明线程/块索引与grid-stride循环的适用性
- 讨论uncoalesced访问与bank conflict对性能的影响
- 必要时说明两阶段归约(block内归约+原子/global累加)
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。