๋ฐฐ๊ฒฝ: ๋๋ฉ์ธโํน์ ์ํคํ ์ฒ์ ํ์์ฑ
2018๋ ISCA์์ Hennessy์ Patterson์ด "์๋ก์ด ํฉ๊ธ์๋"๋ฅผ ์ ์ธํ์ ๋, 1980๋ ๋ ๋๋น CPU ์ฑ๋ฅ ์ฑ์ฅ๋ฅ ์ด 52%์์ 3%๋ก ๊ธ๊ฐํ์ต๋๋ค. Moore's Law์ Dennard Scaling์ด ํ๊ณ์ ๋ค๋ค๋ฅด์, ๊ตฌ๊ธ TPU v1 ๊ฐ์ ๋๋ฉ์ธโํน์ ์ํคํ ์ฒ(DSA)๊ฐ 29๋ฐฐ ๋์ ์ถ๋ก ์ฒ๋ฆฌ๋๊ณผ 80๋ฐฐ ์๋์ง ํจ์จ์ ๋ณด์ฌ์ฃผ๋ฉฐ ์๋ก์ด ํจ๋ฌ๋ค์์ ์ ์ํ์ต๋๋ค.
์ฃผ์ ์ํคํ ์ฒ์ ์ค๊ณ ์ฒ ํ
- GPU (NVIDIA, AMD): ์์ฒ ๊ฐ ์ค๋ ๋๋ฅผ ํ๋ก๊ทธ๋๋จธ๋ธํ๊ฒ ์ด์ํ๊ณ CUDA ์ํ๊ณ๋ก ํตํฉ. Tensor Core์ ์ต์ FP8/FP4 ์ง์์ผ๋ก ๋งคํธ๋ฉ ์ฐ์ฐ์ ๊ฐ์.
- TPU / Trainium: systolicโarray ๊ตฌ์กฐ๋ก ๋งคํธ๋ฉ ์ฐ์ฐ์ ๊ณ ์ ๋ฐ๋๋ก ๋น ๋ฅด๊ฒ ์ํ. ํ์ฌ Gemini ํ์ต๊ณผ Anthropic ์๋น์ค์ ํ์ฉ ์ค.
- WaferโScale Engine (Cerebras): ๋จ์ผ ์นฉ์ ์์ฒ mmยฒ ๋ฉด์ ์ ๋ฐฐ์นํด ๋๊ท๋ชจ ๋ชจ๋ธ ์ถ๋ก ์ ์ ์ง์ฐ์ผ๋ก ์ ๊ณต.
- LPU (Groq): ๊ณ ์ ํ ํ์ดํ๋ผ์ธ์ผ๋ก ์ฐ์ฐ ์ง์ฐ์ ์ต์ํํ์ผ๋ฉฐ, ์ต๊ทผ NVIDIA์ 200์ต ๋ฌ๋ฌ ๊ท๋ชจ๋ก ์ธ์๋์์ต๋๋ค.
๋ฉ๋ชจ๋ฆฌ ๋ฒฝ๊ณผ ๋ฐ์ดํฐ ์ด๋ ์ ๋ต
AI ์ํฌ๋ก๋๋ ๋๋ถ๋ถ ๋งคํธ๋ฉ ์ฐ์ฐ(GEMM, GEMV)์ผ๋ก ๊ตฌ์ฑ๋ฉ๋๋ค. ํ์ตยทํ๋ฆฌํ ๋จ๊ณ๋ ๋๊ท๋ชจ GEMM์ ์๊ตฌํด ์ฐ์ฐ ์ง์ฝ๋๊ฐ ๋์ง๋ง, ๋์ฝ๋ ๋จ๊ณ๋ GEMV๋ก ์ ํ๋ผ ๋ฉ๋ชจ๋ฆฌ ๋์ญํญ์ด ๋ณ๋ชฉ์ด ๋ฉ๋๋ค. ๊ฐ ์ํคํ
์ฒ๋
1) ๋ฐ์ดํฐ๊ฐ ์ด๋์ ๋จธ๋ฌด๋๊ฐ(์จโ์นฉ SRAM, HBM, DRAM),
2) ๋ฐ์ดํฐ ์ด๋ ๊ฒฝ๋ก(NVLink, PCIe, ๋ด๋ถ ๋ฒ์ค),
3) ์ฐ์ฐ ์ ๋ ํํ(Tensor Core, systolic array, ์ฌ๊ตฌ์ฑ ๊ฐ๋ฅํ ๋ฐ์ดํฐํ๋ก) ๋ฅผ ์ต์ ํํด ๋ฉ๋ชจ๋ฆฌ ๋ฒฝ์ ๋์ผ๋ ค ํฉ๋๋ค. ์๋ฅผ ๋ค์ด Hopper H100์ HBM3์ Tensor Memory(TMEM)๋ฅผ ๋์
ํด ๋์ฉ๋ ์ปจํ
์คํธ ์ฒ๋ฆฌ์ ๊ฐ์ ์ ๋ณด์
๋๋ค.
์๋ฌธ: HackerNews AI












