Gorio Tech Blog search

AGQA - A Benchmark for Compositional Spatio-Temporal Reasoning 설명

|

이번 글에서는 AGQA: A Benchmark for Compositional Spatio-Temporal Reasoning 논문을 정리한다. 2021년 3월(Arxiv), CVPR 2021 Madeleine Grunde-McLaughlin, Ranjay Krishna, Maneesh Agrawala 홈페이지 논문 링크 Github Abstract Visual event는 object들과 공간적으로(spatially) 상호작용하는 actor들을 포함하는 temporal action들로 구성된다. 이를 위해 여러 벤치마크 및 모델들이 개발되었지만 단점들이 많았다. 본 논문에서는 compositional spatio-temporal reasoning을...

Comment  Read more

LoRA - Low-Rank Adaptation of Large Language Models 요약 설명

|

이번 글에서는 LoRA: Low-Rank Adaptation of Large Language Models 논문의 핵심 포인트만 간단히 정리한다. 2021년 10월(Arxiv), ICLR 2022 Edward J. Hu, Yelong Shen, Phillip Wallis et al. 논문 링크 Github GPT-3같은 거대한 모델을 fine-tuning하면 그 엄청난 parameter들을 다 재학습시켜야 함 → 이는 계산량도 많고 시간도 꽤 걸리는 부담스러운 작업이다. 이를...

Comment  Read more

GTN(Gated Transformer Networks for Multivariate Time Series Classification) 요약 설명

|

이번 글에서는 Gated Transformer Networks for Multivariate Time Series Classification 논문의 핵심 포인트만 간추려서 기술합니다. 논문 링크 본 논문에서는 MTS(Multivariate Time Series) 문제를 풀기 위해 transformer 구조를 활용하는 방법에 대해 기술하고 있습니다. Multivariate Time Series task의 핵심은 stpe-wise(temporal) 정보와 channel-wise(spatial) 정보를 모두 잘 포착하는 것입니다. 본 논문은 step-wise encoder와 channel-wise...

Comment  Read more

ScaleNorm - Transformers without Tears(Improving the Normalization of Self-Attention) 요약 설명

|

이번 글에서는 Transformers without Tears(Improving the Normalization of Self-Attention) 논문의 핵심 포인트만 간추려서 기술합니다. 논문 링크 본 논문에서는 Transformer에서 사용되는 Normalization layer를 개선하는 방법에 대해 기술하고 있습니다. 논문에서 여러 내용을 다루고 있지만 핵심 포인트는 2가지 입니다. 일단 normalization layer는 PRENORM이어야 한다는 것입니다. original Transformer에서는 POSTNORM을 사용하고 있는데, 실험 결과를 보면...

Comment  Read more

Recommendation for new users & items via randomized training and M-o-E transformation 요약 설명

|

이번 글에서는 Recommendation for new users & items via randomized training and M-o-E transformation 논문의 핵심 포인트만 간추려서 기술합니다. 논문 링크 본 논문에서는 일반적인 CF 구조의 문제를 3가지로 지적합니다. 최종 loss는 CF loss + Transformation loss로 이루어지는데, separate-training (user/item representation을 별도로 학습) 방법의 경우 이를 따로 따로 학습하다 보니 괴리가...

Comment  Read more