30 台報廢 Mac mini 復活 1976 年 Cray-1 超級電腦:1.5 TFLOPS、9,375 倍算力,半世紀晶片進步有多驚人?

晶片觀測站2026/10/1112 min read
分享

30秒摘要

西班牙電腦歷史博物館耗時 18 個月,使用 30 台 2012 至 2014 年的 Intel Mac mini,打造出一台與 1976 年傳奇超級電腦 Cray-1 等比例的可運作複製品。這套由 70 個 CPU 核心組成的叢集曾達到 1.5 TFLOPS,相當於原版 Cray-1 理論峰值 160 MFLOPS 的 9,375 倍。更特別的是,它使用自然對流散熱、macOS Mojave 與 MPI 分散式運算技術。然而,這項成就背後也有值得探討的技術差異:現代多核心叢集與 1970 年代的向量超級電腦,究竟能不能直接比較?

重點摘要

  1. 01西班牙電腦歷史博物館耗時 18 個月,使用 30 台舊 Intel Mac mini 打造等比例 Cray-1 複製品。
  2. 0225 台雙核心 i5 加上 5 台四核心 i7,組成最多 70 個 CPU 核心的分散式叢集。
  3. 03複製品曾達到 1.5 TFLOPS,與原版 Cray-1 的 160 MFLOPS 理論峰值相比,數值比例達 9,375 倍。
  4. 04團隊使用 macOS Mojave 與 MPI 執行跨主機平行運算,並以 Python 矩陣乘法測試效能。
  5. 05機櫃利用鋼製結構、鋁製托盤與自然對流散熱,運作時相當安靜。
  6. 06博物館計畫進一步安裝 70 至 80 台 M4 Mac mini,並嘗試挑戰 TOP500 超級電腦排行榜。

一、1976 年的超級電腦,竟然被 30 台舊 Mac mini 超越了?

如果把時間倒回 1976 年,世界上最強大的電腦並不是放在桌上的個人電腦,而是一台外形宛如未來主義雕塑、需要專業冷卻系統、價格高達數百萬美元的巨型機器。

它的名字叫做 Cray-1。

由美國電腦工程師 Seymour Cray 設計的 Cray-1,是超級電腦歷史上極具代表性的機種。它以獨特的 C 字形機櫃、環繞機身的座椅,以及當時極為先進的向量運算架構聞名。

50 年後,西班牙的 Museo de Historia de la Computación(電腦歷史博物館)決定重新打造這台經典機器。

不過,這次他們沒有試圖重製 1970 年代的電路板,而是採用一個非常有趣的方案:把 30 台十多年前的 Apple Mac mini 裝進 Cray-1 的外殼裡。

這些電腦大多來自 2012 年,另外有兩台為 2014 年機型。它們採用 Intel Core i5 與 Core i7 處理器,在今天已經屬於相當老舊的消費級硬體。

但當 30 台機器透過網路連接,組成可協同運算的叢集後,整套系統曾達到 1.5 TFLOPS 的浮點運算效能。

原版 Cray-1 的理論峰值則約為 160 MFLOPS。

換算後,兩者相差 9,375 倍。

這不是一台現代旗艦工作站擊敗古董電腦,而是一批十多年前就已經上市的消費級主機,組成了效能遠超當年世界頂級超級電腦的系統。

這項計畫同時紀念 Cray-1 首次投入運作與 Apple 創立 50 週年,也讓參觀者透過一台實際運作的展品,理解半個世紀的運算技術究竟發生了什麼變化。

二、先認識真正的 Cray-1:1976 年的運算怪物

Cray-1 於 1976 年在美國洛斯阿拉莫斯國家實驗室投入運作,成為超級電腦發展史上的重要里程碑。

它由 Cray Research 開發,主要服務科學研究、國防、工程模擬與大型數值計算。

在當時,一般電腦處理大量數值資料時,往往需要重複執行許多單獨的運算指令。

Cray-1 的突破在於採用 Vector Processing(向量處理)。

例如,科學家需要將兩組各包含數千個數值的資料逐項相加。

傳統純量運算可以理解為反覆處理單一數值,而向量處理器則能利用專門的向量指令與管線化硬體,連續處理整批資料。

這使 Cray-1 特別適合矩陣運算、流體力學、天氣模擬與其他科學計算。

Cray-1 採用 64 位元架構,時脈約 80 MHz,理論峰值達到 160 MFLOPS,也就是每秒約 1.6 億次浮點運算。

今天看來,這個數字可能不算驚人,但在 1976 年,它代表當時極為昂貴且專業的運算能力。

Cray-1 也不是普通企業可以輕易購買的設備。它需要專門的機房、供電與冷卻設施,並由專業團隊維護。

其獨特的 C 字形設計不只是美學選擇,也與縮短電路連線距離、控制訊號傳播延遲等工程考量有關。

在高速運算系統中,資料移動的距離與時間同樣重要。

這個問題直到今天仍然存在,只是從當年的電路板與訊號線,延伸到了現代 GPU 之間的高速互連、HBM 記憶體與資料中心網路。

三、30 台 Mac mini 的硬體配置:70 個核心如何組成一台超級電腦?

西班牙博物館的複製品並沒有使用最新的 Apple Silicon 晶片。

整套系統由 30 台 Intel 時代的 Mac mini 組成,配置如下。

硬體類型數量每台 CPU 核心合計核心
Intel Core i5 Mac mini25 台2 核心50
Intel Core i7 Mac mini5 台4 核心20
總計30 台70 核心

這些主機透過網路交換器連接,組成一套可以分配運算工作的叢集系統。

根據 Ars Technica 的報導,團隊使用自行開發的 Python 矩陣乘法測試程式評估效能。

在全部 70 個核心可用時,系統曾達到約 1.5 TFLOPS。

後來部分節點離線,近期測試以 64 個可用核心取得約 1.3 TFLOPS。

這裡有個值得注意的細節。

報導提到有一台四核心 Mac mini 離線,但總核心數從 70 降至 64,差距為六個核心。現有公開報導沒有完整交代全部核心數變化的原因,因此不應將六核心差額完全歸因於單台四核心主機故障。

更重要的是,這 70 個核心並不是一顆 70 核心 CPU。

它們分散在 30 台不同的電腦中,每台都有自己的記憶體、作業系統與運算資源。

這種架構稱為 Computer Cluster(電腦叢集)。

叢集的核心概念,是讓多台獨立電腦協同執行大型工作,而不是要求所有工作都由單一處理器完成。

四、9,375 倍究竟怎麼算出來?

這個數字其實來自相當直接的單位換算。

原版 Cray-1 的理論峰值約為 160 MFLOPS。

1 TFLOPS 等於 1,000,000 MFLOPS,因此 1.5 TFLOPS 相當於 1,500,000 MFLOPS。

計算如下:

1,500,000 ÷ 160 = 9,375

因此,以這兩個數字比較,30 台 Mac mini 組成的叢集確實達到原版 Cray-1 標稱峰值的 9,375 倍。

如果採用近期測得的 1.3 TFLOPS,結果則是:

1,300,000 ÷ 160 = 8,125

也就是約 8,125 倍。

不過,這裡有一個重要的技術限制。

Cray-1 的 160 MFLOPS 是歷史上的理論峰值,而複製品的 1.5 TFLOPS 來自團隊自製的矩陣乘法測試。

兩者並不是相同程式、相同資料集、相同精度設定下的標準化測試結果。

此外,原始報導沒有提供足夠資訊,讓外界完整確認複製品測試中的浮點精度、運算次數計算方法與跨節點通訊成本。

因此,9,375 倍應理解為兩個公開效能數字之間的換算比例,而不是所有實際工作負載的通用加速倍率。

這個差異並不會削弱展品的教育價值,反而讓它成為理解 Benchmark(效能基準測試)的絕佳案例。

五、原版 Cray-1 與 Mac mini 叢集,其實是兩種不同的運算哲學

如果只看 FLOPS,現代叢集似乎全面超越了原版 Cray-1。

但從電腦架構角度來看,兩者的設計理念完全不同。

原版 Cray-1 是一台專門打造的向量超級電腦。

它依賴高速向量管線、特殊暫存器與高度整合的記憶體架構,盡可能提高單一系統處理科學數值運算的效率。

Mac mini 複製品則是由 30 台通用電腦組成的分散式叢集。

它透過多台 CPU 同時執行不同部分的計算,再將結果整合。

兩種架構都能提高運算吞吐量,但面臨的瓶頸不完全相同。

原版 Cray-1 的設計重點之一,是讓向量資料在專用硬體中快速流動。

Mac mini 叢集則必須考慮跨主機通訊、資料分配與工作同步。

如果一個任務可以輕易拆成許多彼此獨立的部分,叢集可能獲得相當好的加速效果。

但如果每個運算步驟都需要頻繁交換大量資料,網路延遲與頻寬就可能成為限制。

這也是現代 AI 超級電腦大量投資高速互連技術的原因。

從 NVIDIA NVLink 到 InfiniBand,再到各種高效能乙太網路方案,核心目標之一都是降低運算節點之間的資料交換成本。

換句話說,現代超級電腦不只是比較誰擁有更多核心,也要比較這些核心能不能有效合作。

六、MPI 是什麼?為什麼 macOS Mojave 也能跑超級電腦?

這次複製計畫另一個有趣之處,是團隊沒有選擇一般 HPC 領域常見的 Linux 叢集環境,而是使用 macOS Mojave 10.14。

讓多台 Mac mini 協同工作的關鍵,是 Message Passing Interface,簡稱 MPI。

MPI 是高效能運算領域常用的訊息傳遞標準。

在分散式運算中,每台電腦通常擁有獨立的記憶體空間。

因此,當某個節點需要其他節點計算的結果時,就必須透過通訊機制交換資料。

MPI 提供一套標準化介面,讓程式能夠在不同運算程序之間傳送、接收及同步資料。

例如,一個大型矩陣乘法工作可以被拆成多個子問題。

不同 Mac mini 負責處理部分矩陣區塊,再透過 MPI 傳遞必要資料與整合結果。

這讓多台原本獨立的電腦,可以共同完成單台電腦難以快速處理的任務。

不過,MPI 並不是讓 30 台電腦自動變成一顆大型 CPU 的魔法。

程式本身仍然需要設計適當的資料切分、平行工作分配與同步策略。

如果任務拆分不合理,增加節點反而可能帶來更多通訊成本。

此外,macOS 可以執行 MPI 工作負載,不代表所有 MPI 實作都是 macOS Mojave 原生內建,實際仍需要對應的軟體環境與工具鏈。

這套系統的價值,在於展示即使不是專業 HPC 伺服器,也能透過適當軟體建立可運作的分散式運算平台。

七、最令人意外的設計:幾乎無聲的被動散熱

原版 Cray-1 的冷卻系統,是當年高效能電腦工程的重要部分。

由於高速電路產生大量熱能,Cray-1 使用液體冷卻相關設備,並搭配位於其他空間的大型製冷系統。

當時的超級電腦不只需要強大的處理器,也需要昂貴的機電設施維持運作。

但西班牙博物館的複製品採用了截然不同的方法。

團隊把 Mac mini 垂直安裝在鋁製托盤上,再利用鋼製機櫃形成適合空氣流動的結構。

當機器運作產生熱量時,溫暖的空氣會因密度差異自然上升,形成對流。

這種方式稱為 Natural Convection(自然對流)。

它不需要額外使用大型機房風扇來強制推動空氣。

根據報導,整套系統運作時相當安靜,最明顯的噪音反而來自乙太網路交換器。

博物館甚至計畫更換為更安靜的交換器,進一步降低噪音。

不過,這裡的被動散熱主要指機櫃層級的自然對流設計,不代表每台 Mac mini 內部都完全沒有風扇。

此外,沒有公開完整的長時間滿載溫度與功耗測試,因此不能據此推論這套系統在所有環境條件下都能維持相同散熱效果。

這仍然是一項很有意思的機構工程實驗:利用機櫃幾何形狀與材料配置,改善多台電腦集中運作時的熱管理。

八、從 1976 年到 2026 年:摩爾定律到底帶來了什麼?

Cray-1 複製計畫最有教育價值的地方,是它把半導體產業 50 年的進步變成了可以直接觀察的實體裝置。

1976 年,160 MFLOPS 需要昂貴的專用超級電腦。

2026 年,30 台已經服役十多年的消費級電腦,卻能在特定測試中達到超過 1 TFLOPS。

這種變化與半導體製程、電晶體密度、處理器架構、記憶體技術及軟體平行化能力的長期進步有關。

摩爾定律最初描述的是積體電路上電晶體數量隨時間增加的趨勢,而不是保證運算效能必然以固定速度成長。

實際效能還受到時脈、指令集、快取、記憶體頻寬、核心數與軟體設計影響。

早期處理器的效能提升,部分來自提高時脈與改善單核心執行效率。

隨著功耗密度與散熱限制逐漸成為問題,產業開始更重視多核心、向量指令與專用加速器。

Intel Core i5 與 Core i7 處理器已經具有比早期超級電腦複雜得多的微架構,也支援現代 SIMD 向量指令。

而今天的 GPU 與 AI 加速器,更進一步使用大量平行運算單元、專門的矩陣運算硬體與高頻寬記憶體。

因此,Cray-1 與 Mac mini 的比較不只是製程進步的故事,也是一部電腦架構逐漸走向高度平行化的歷史。

九、為什麼現代超級電腦不能只靠堆疊更多 Mac mini?

既然 30 台舊 Mac mini 就能達到 1.5 TFLOPS,那麼把數量增加到 300 台、3,000 台,是否就能建立真正的頂級超級電腦?

答案沒有這麼簡單。

在理想情況下,如果工作可以完全平行化,增加運算節點確實可能提高總吞吐量。

但實際上,叢集效能受到許多因素限制。

首先是網路頻寬。

當大量節點需要交換矩陣資料、模型參數或其他中間結果時,網路可能成為瓶頸。

其次是通訊延遲。

即使資料量不大,頻繁的同步操作也可能讓處理器等待其他節點。

第三是記憶體架構。

每台 Mac mini 擁有自己的記憶體,不能直接把 30 台機器的 RAM 當成單一共享記憶體使用。

第四是可靠性。

當節點數量增加,硬體故障、網路異常與軟體環境不一致的管理成本也會上升。

第五是能源效率。

舊電腦雖然可以重新利用,但其每瓦效能未必能與新一代專業運算設備競爭。

這些問題可以透過 Amdahl's Law(阿姆達爾定律) 來理解。

如果一個程式仍有部分工作無法平行化,那麼無論增加多少處理器,整體加速效果都會受到限制。

因此,30 台 Mac mini 組成的系統是很好的 HPC 教育平台,但不能直接等同於現代研究機構使用的高密度 GPU 超級電腦。

十、博物館下一步:70 至 80 台 M4 Mac mini,挑戰 TOP500?

目前這項計畫並沒有停留在 30 台舊電腦的階段。

根據 Tom's Hardware 與 Ars Technica,博物館團隊計畫透過群眾募資,取得約 70 至 80 台採用 Apple M4 晶片的 Mac mini,填滿複製品中剩餘的安裝空間。

團隊甚至希望未來能嘗試進入 TOP500 超級電腦排行榜。

這是一個非常大膽的目標,但也需要用技術角度審慎看待。

TOP500 主要使用 High Performance LINPACK,也就是 HPL 基準測試評估超級電腦的 FP64 雙精度浮點效能。

這與自製 Python 矩陣乘法測試的數字,不能直接視為相同指標。

即使 M4 Mac mini 在單機效能上大幅超越舊 Intel 機型,整體叢集能否取得足夠高的 HPL 成績,仍取決於 CPU 與 GPU 的雙精度運算能力、軟體支援、網路架構及平行效率。

此外,TOP500 的入榜門檻會隨著全球超級電腦效能進步而提高。

因此,現階段應將挑戰 TOP500 視為博物館提出的未來目標,而不是已經確認可以達成的結果。

不過,即使最後沒有進入排行榜,使用新一代 Apple Silicon 與舊 Intel Mac mini 進行同一套分散式運算測試,仍然能成為很有價值的跨世代架構比較。

十一、復古外殼不只是裝飾:讓超級電腦歷史變得看得見

這次複製計畫並不只有運算效能。

團隊還重新打造了 Cray-1 標誌性的 C 字形外觀,以及圍繞機櫃的座椅設計。

機身內部可以看到垂直排列的 Mac mini,形成一種跨越半世紀的硬體展示。

控制台則參考 1970 年代的 DEC VT05 與 Processor Technology Sol-20 等電腦設備,採用具有復古風格的金屬桌面、鍵盤與多螢幕配置。

團隊也加入類比控制面板,並計畫整合其他歷史電腦設備的視覺元素。

原本曾考慮使用 CRT 映像管螢幕,但為了降低跨世代硬體連接的複雜度,最終採用現代平面顯示器。

參觀者可以觀看系統實際執行矩陣運算,理解不同核心數量下的平行運算表現。

這種展示方式比單純陳列一台停止運作的古董電腦更有教育意義。

它不只告訴參觀者 Cray-1 曾經多麼強大,也讓人直接看到今日看似過時的消費級電腦,已經擁有何等驚人的運算能力。

十二、結論:50 年後,超級電腦不再只是少數實驗室的特權

1976 年,Cray-1 代表的是世界頂級的工程能力。

它需要專業設計的向量處理器、特殊機櫃、昂貴的冷卻系統,以及只有少數研究機構能負擔的預算。

2026 年,一群工程師卻能利用 30 台舊 Mac mini、網路交換器、MPI 軟體與自行設計的機櫃,重新打造一台具有歷史外觀、能夠實際進行平行運算的複製品。

這並不代表今天的舊 Mac mini 在所有方面都優於原版 Cray-1,也不代表 FLOPS 是衡量電腦能力的唯一標準。

真正值得思考的是:曾經需要國家級研究預算才能取得的運算能力,如今已經能由普通消費級硬體重新組合實現。

從 Cray-1 的向量處理器,到 Intel 多核心 CPU,再到今天的 GPU 與 AI 加速器,半導體產業走過的不只是電晶體越做越小的歷史。

它也是一部關於如何讓更多運算單元有效合作、如何移動資料,以及如何控制能源與散熱成本的工程史。

而這台由 30 台舊 Mac mini 組成的 Cray-1 複製品,正好把這 50 年的故事濃縮成了一件可以親眼看見的作品。


Tech English:本文技術名詞

1. FLOPS(每秒浮點運算次數):衡量電腦執行浮點數計算能力的指標。MFLOPS 代表每秒百萬次,TFLOPS 代表每秒兆次,但不同精度與測試方法的數字不能直接等同。

2. Vector Processing(向量處理):使用專門的向量指令與硬體,對多個資料元素執行同類型運算的技術,是 Cray-1 的核心設計特色。

3. Computer Cluster(電腦叢集):將多台獨立電腦透過網路連接,協同執行運算工作的系統架構。

4. Message Passing Interface, MPI(訊息傳遞介面):高效能運算中常用的標準,讓不同運算程序或節點交換資料與同步工作。

5. Natural Convection(自然對流):利用空氣溫度與密度差異形成流動,協助設備散熱,而不依賴額外的強制氣流裝置。

6. High Performance LINPACK, HPL(高效能 LINPACK 測試):TOP500 超級電腦排行榜使用的主要基準測試,透過大型線性方程組計算評估系統的雙精度浮點運算效能。

Core takeaway

西班牙電腦歷史博物館使用 30 台 2012 至 2014 年的 Intel Mac mini,打造出可運作的 Cray-1 等比例複製品,最高曾達 1.5 TFLOPS。相較於原版 Cray-1 的 160 MFLOPS 理論峰值,數字比例為 9,375 倍,但兩者架構與測試方法不同。

Why it matters

這項計畫以實體展品展示半導體、CPU 架構與平行運算在 50 年間的進步,也說明高效能運算不只取決於處理器效能,還需要考慮節點通訊、軟體設計、散熱與能源效率。

Data story

04

30 台

用於建造 Cray-1 複製品的 Intel Mac mini

Ars Technica包含 25 台雙核心 Core i5 與 5 台四核心 Core i7。

1.5 TFLOPS

70 核心配置曾達到的測試效能

Ars Technica來自團隊自製 Python 矩陣乘法測試,不是標準 HPL 成績。

1.3 TFLOPS

近期 64 個可用核心的測試效能

Ars Technica部分運算節點離線後的報導數字。

160 MFLOPS

1976 年原版 Cray-1 理論峰值

Tom's Hardware歷史理論峰值,與複製品自製測試並非相同基準。

Tech index

15
01Cray-1
02Vector Processing
03Intel Core i5
04Intel Core i7
05Apple Mac mini
06Apple Silicon M4
07High Performance Computing
08MPI
09Computer Cluster
10FLOPS
11Python
12Natural Convection
13TOP500
14LINPACK
15Amdahl's Law

限制與注意

08
  1. 011.5 TFLOPS 是團隊曾達到的測試數字,近期報導的運作配置為 64 個核心、約 1.3 TFLOPS。
  2. 029,375 倍是不同年代公開效能數字的換算比例,不是使用同一標準基準測試取得的實際加速倍率。
  3. 03原版 Cray-1 為專用向量處理器系統,複製品則是由 30 台通用電腦組成的 MPI 叢集,不能視為架構相同。
  4. 04複製品的測試採用自製 Python 矩陣乘法程式,公開報導未提供足夠細節以完整驗證浮點精度與 FLOPS 計算方法。
  5. 05報導提及一台四核心節點離線,但核心總數由 70 降至 64 的完整原因尚未清楚說明。
  6. 06被動散熱指機櫃使用自然對流,不代表所有 Mac mini 內部都完全沒有主動散熱元件。
  7. 0770 至 80 台 M4 Mac mini 與挑戰 TOP500 均屬未來規劃,尚未完成或取得入榜資格。
  8. 08本文未估算複製品的實際整機功耗、每瓦效能或完整建造成本,因缺乏可驗證的實測資料。

資料來源

04
01

Ars Technica:A Cray-1 supercomputer replica from 30 obsolete Mac Minis

news

02

Tom's Hardware:Working Cray-1 supercomputer replica packs 30 vintage Mac Minis

technical

03

AppleInsider:30 old Intel Mac minis are hugely faster than the Cray-1 chassis they live in

news

04

PC Central:Cray-1 Replica Cluster Hits 1.5 TFLOPS

news

原始來源

arstechnica.com

相關公司

Apple

AAPLNASDAQ· 消費電子

Intel

INTCNASDAQ· 半導體

Cray Research

Cray Research

Hewlett Packard Enterprise

Hewlett Packard Enterprise
延伸探索 · CHIP INSIGHT NETWORK

相關文章

探索更多 →