HW3는 빨간불을 못 본다? 엔지니어가 다시 봅니다.
Drive Tech Odyssey · 조회수 1.5만회
인기 댓글
2위@mmks27214일 전
녀석들은 차를 사는게 아니야 종교를 산거지번역 보기
👍 23 좋아요
댓글 0
· 로그인 없이 익명 동물 이름으로 참여합니다3위@나이트퓨리-y4p4일 전
아.. 나도 테슬라 타지만 테슬람들 말하고 행동하는것들 극혐이네... 쉬벨...과학5호기 느낌이여..번역 보기
👍 30 좋아요
댓글 0
· 로그인 없이 익명 동물 이름으로 참여합니다관련 영상
살 수 없는 최고의 중국산 GPU - Lishan Tech LX 7G100
한국 고등학생들이 블랙홀 열역학의 20년 난제를 풀어낸 방법
[풀영상] 14년째 수감 중인 초등학교 중퇴 범죄자가 억울함을 주장하는 이유는?
과학자들이 예측한 우주의 마지막, 뭐가 남을까?
[특집] 과학이 밝힌 네팔 대홍수의 진짜 원인, #네팔홍수, #산사태, #위성사진
이론상 건축이 불가능한 초고층 빌딩의 높이는 얼마나 될까? | 과학을 보다 EP.216
물화생천 대표 교수님들이 경쟁 PT로 붙으면 생기는 일🔥| 과학을 보다 200회 특집 3부
지구와 닮은 슈퍼지구에 정말 생명체가 살 수 있을까? | 과학을 보다 EP.217
1위@makinghardware6일 전(수정됨)
이 영상에도 오류가 있는 것 같네요. 일단 Distillation하고 양자화(Quantization)는 명백하게 다른 독립적인 기술입니다. Distillation은 증류 학습을 통해서 애초에 layer 개수랑 hidden dimension 자체가 적은 더 작은 모델을 만드는거고요, quantization은 말씀하신대로 bit 수를 줄이는 겁니다. Distillation하고 Quantization을 또 할 수 있는 셈이죠. 그리고 Quantization을 한다고 속도가 빨라지는 것도 아닙니다. 연산 칩이 해당 precision 지원을 해야하죠. 테슬라는 HW3 시절부터 INT8 MAC 중심의 연산기를 사용하고 있었고, HW4에서도 INT8 MAC을 사용합니다. 하드웨어가 INT4, NVFP4 같은걸 지원 안하는데 여기서 quantization 해봐야 절대로 속도 안 올라갑니다. 오히려 파라미터를 줄였다가도 연산 시점에서 다시 INT8 format으로 바꿔줘야 하니 훨씬 느려지고요. 그나마 on-chip에서 dequantization하고 연산하는 방향이면, memory bound 연산 한정해서 속도가 올라갈 가능성이 있는데 HW3에 그런 dequantize 기능이 들어가 있을 가능성도 희박합니다. 애초에 FSD가 ViT나 Diffusion 중심으로 설계되어 있을 가능성이 크다는 점을 고려하면 모델 자체도 compute bound에 가까울 가능성이 높죠. 그러니까 FSD -> FSD lite 로 넘어가면서 다른 비트 수를 써서 파라미터가 작아졌을 가능성이 있다? 이거야 말로 말도 안되는 소리입니다. 저도 FSD 모델의 정확한 구조는 모릅니다. 여러 모델의 합으로 이루어져 있을 가능성이 있으니 실제 가중치가 몇 배냐를 따질 수는 없지만 해당 사진에서의 활성화 파라미터 기준 모델이 5배 작아진 건 명백히 맞습니다.번역 보기
👍 62 좋아요
댓글 0
· 로그인 없이 익명 동물 이름으로 참여합니다