閱界資訊

從筆記本到 AWS:我的 ParallelCluster 科研工作流

閱閱界編輯部1閱讀6分鐘

《從筆記本到 AWS:我的 ParallelCluster 科研工作流》是近期少數派的好帖,信息密度大。下面分段講清它的核心內容,看到結尾你就知道該怎麼做了。

2026年08月02日 13 分鐘閱讀 從筆記本到 AWS:我的 ParallelCluster 科研工作流 主作者 關注 Ney 新手上路 Ney 關注 Ney 新手上路 聯合作者 關注 Ney 新手上路 Ney 關注 Ney 新手上路 13 分鐘閱讀 微信掃碼分享 以圖片分享 分享到微博 點擊下方按鈕可複製鏈接 分享 收藏 舉報 AI 輔助說明:本文基於作者的實際運行日誌、基準測試記錄和 AWS 賬單寫成。Claude Code 用於部分集羣操作與故障排查;ChatGPT 和 Claude Code 用於討論文章結構、檢查技術表述與文字整理。文中的配置、時間、費用與技術結論均由作者依據原始記錄覈對。 今年夏天,我把一篇 論文 的計算部分搬上了 AWS。筆者想要通過這篇筆記,記錄跑通的方案,和那些花掉時間或金錢的坑。

2026年08月02日 13 分鐘閱讀 從筆記本到 AWS:我的 ParallelCluster 科研工作流 主作者 關注 Ney 新手上路 Ney 關注 Ney 新手上路 聯合作者 關注 Ney 新手上路 Ney 關注 Ney 新手上路 13 分鐘閱讀 微信掃碼分享 以圖片分享 分享到微博 點擊下方按鈕可複製鏈接 分享 收藏 舉報 AI 輔助說明:本文基於作者的實際運行日誌、基準測試記錄和 AWS 賬單寫成。Claude Code 用於部分集羣操作與故障排查;ChatGPT 和 Claude Code 用於討論文章結構、檢查技術表述與文字整理。文中的配置、時間、費用與技術結論均由作者依據原始記錄覈對。 今年夏天,我把一篇 論文 的計算部分搬上了 AWS。筆者想要通過這篇筆記,記錄跑通的方案,和那些花掉時間或金錢的坑。在這裏我不會談論文本身,而是想要記錄一個任何「同一個腳本,換着參數跑很多遍」的項目都可以照搬的實踐。

2026年08月02日 13 分鐘閱讀 從筆記本到 AWS:我的 ParallelCluster 科研工作流 主作者 關注 Ney 新手上路 Ney 關注 Ney 新手上路 聯合作者 關注 Ney 新手上路 Ney 關注 Ney 新手上路 13 分鐘閱讀 微信掃碼分享 以圖片分享 分享到微博 點擊下方按鈕可複製鏈接 分享 收藏 舉報 AI 輔助說明:本文基於作者的實際運行日誌、基準測試記錄和 AWS 賬單寫成。Claude Code 用於部分集羣操作與故障排查;ChatGPT 和 Claude Code 用於討論文章結構、檢查技術表述與文字整理。文中的配置、時間、費用與技術結論均由作者依據原始記錄覈對。 今年夏天,我把一篇 論文 的計算部分搬上了 AWS。筆者想要通過這篇筆記,記錄跑通的方案,和那些花掉時間或金錢的坑。在這裏我不會談論文本身,而是想要記錄一個任何「同一個腳本,換着參數跑很多遍」的項目都可以照搬的實踐。文中所有時間和金額都來自運行日誌、當時留下的基準測試記錄和 EC2 實例記錄。

2026年08月02日 13 分鐘閱讀 從筆記本到 AWS:我的 ParallelCluster 科研工作流 主作者 關注 Ney 新手上路 Ney 關注 Ney 新手上路 聯合作者 關注 Ney 新手上路 Ney 關注 Ney 新手上路 13 分鐘閱讀 微信掃碼分享 以圖片分享 分享到微博 點擊下方按鈕可複製鏈接 分享 收藏 舉報 AI 輔助說明:本文基於作者的實際運行日誌、基準測試記錄和 AWS 賬單寫成。Claude Code 用於部分集羣操作與故障排查;ChatGPT 和 Claude Code 用於討論文章結構、檢查技術表述與文字整理。文中的配置、時間、費用與技術結論均由作者依據原始記錄覈對。 今年夏天,我把一篇 論文 的計算部分搬上了 AWS。筆者想要通過這篇筆記,記錄跑通的方案,和那些花掉時間或金錢的坑。在這裏我不會談論文本身,而是想要記錄一個任何「同一個腳本,換着參數跑很多遍」的項目都可以照搬的實踐。文中所有時間和金額都來自運行日誌、當時留下的基準測試記錄和 EC2 實例記錄。 爲什麼上雲 這篇文章裏主要的工作負載是給梯度提升樹訓練調參:按預測期(提前 1 到 24 個月)分別做,網格里每個候選參數都要沿幾百個滾動窗口反覆重新擬合。

2026年08月02日 13 分鐘閱讀 從筆記本到 AWS:我的 ParallelCluster 科研工作流 主作者 關注 Ney 新手上路 Ney 關注 Ney 新手上路 聯合作者 關注 Ney 新手上路 Ney 關注 Ney 新手上路 13 分鐘閱讀 微信掃碼分享 以圖片分享 分享到微博 點擊下方按鈕可複製鏈接 分享 收藏 舉報 AI 輔助說明:本文基於作者的實際運行日誌、基準測試記錄和 AWS 賬單寫成。Claude Code 用於部分集羣操作與故障排查;ChatGPT 和 Claude Code 用於討論文章結構、檢查技術表述與文字整理。文中的配置、時間、費用與技術結論均由作者依據原始記錄覈對。 今年夏天,我把一篇 論文 的計算部分搬上了 AWS。筆者想要通過這篇筆記,記錄跑通的方案,和那些花掉時間或金錢的坑。在這裏我不會談論文本身,而是想要記錄一個任何「同一個腳本,換着參數跑很多遍」的項目都可以照搬的實踐。文中所有時間和金額都來自運行日誌、當時留下的基準測試記錄和 EC2 實例記錄。 爲什麼上雲 這篇文章裏主要的工作負載是給梯度提升樹訓練調參:按預測期(提前 1 到 24 個月)分別做,網格里每個候選參數都要沿幾百個滾動窗口反覆重新擬合。24 個預測期之間從不通信,任務是教科書意義上的非常適合並行:我需要的不是一臺更大的電腦,而是很多臺普通的電腦,一起開工,用完即棄。

讀完別停:把最觸動你的一條記下來,這周就用上。能落地的閱讀纔算數,歡迎回來聊聊你的實踐結果。 來源|博客園《從筆記本到 AWS:我的 ParallelCluster 科研工作流》,https://sspai.com/post/94573

工具方法效率方法

評論(0)

暫無評論,來搶第一條。