구조
RNN은 seq2seq이어서 대규모의 데이터 병렬처리가 어려웠는데 트랜스포머부터는 가능. multi head attention의 head들을 각각 다른 gpu에 뿌려서 학습가능. 트랜스포머는 작은모델 6층/6층 큰모델 12층씩gpt4는 디코더 층도 100 200 넘어감 rnn은 번역, 요약 등등 모델이 다 따로 있었는데 트랜스포머는 다양한 task 동시에 가능--대규모 데이터 + 컴퓨팅파워anthropic: openai에서 탈출한 사람들이 만듦. 기술은 그대로 갖고있되,,, 반기를 들음meta llama, deepseek, X groq3 Multi Lingual을 놓치고 있따! gpt는 58개국어가능한데 아직 다른애들은 x.. 그래도 다개국어 가능--transformer까지는 지도학습이었음.BERT는 t..