正文内容 评论(0)
快科技9月30日消息,海外用户Future_Fuel_8425分享了一段自己本地跑大模型的经历,其在一台搭载128GB DDR4 ECC内存的工作站上运行35B参数大模型Ornith-1.5-35B-A3B,仅90分钟后就烧坏了一根DDR4内存条,8至9天后第二根也开始报错。
该用户使用的是2019年款ThinkStation P920,配备双路至强处理器和128GB DDR4 ECC内存(16根8GB内存条),显卡为RTX 5070 Ti 16GB。
此前半年该用户一直运行20B及以下的小模型,全部装在显存中,即使长时间高负载运行也没出过问题。
这次因数据库任务需要更大模型,切换到35B的Ornith-1.5后,模型部分溢出到系统内存,90分钟后系统崩溃,日志显示第8插槽的内存条ECC错误堆积,拔掉该内存条后恢复正常。
没想到继续重度使用8至9天后,日志显示另一根内存条也即将失效。
用户强调温度不是问题,CPU从未超过80°C,GPU很少超过65°C,还配备了辅助散热,所有内存条均为同一批次匹配条,推测只是老化严重,经不住长时间高强度的连续读取。
不过用户只提到了CPU和GPU温度,并未展示内存温度数据,DDR4内存老化和长时间连续顺序读取高负载叠加,加上内存条本身散热条件有限,很可能是内存损坏的真实原因。

- 热门文章
- 换一波
- 好物推荐
- 换一波
- 关注我们
-
微博:快科技官方
快科技官方微博 -
今日头条:快科技
带来硬件软件、手机数码最快资讯! -
抖音:kkjcn
科技快讯、手机开箱、产品体验、应用推荐...
