INTRO안녕하세요! 윤짱입니다.저는 사실 대학원생인데요, 그동안 현생에 치여서 블로그를 쓰지 못했답니다:(다시 시작해보려고 해요! 회고저는 AI 관련 학과를 졸업하고, 1년 정도 진로 고민과 인턴 생활을 하며, 대학원 진학을 결심하게 됐어요!대학원을 결심한 계기에는 여러가지가 있었는데요,가장 큰 이유는 제 전공 분야를 더 깊이 공부하고 생각 때문이었습니다.연구를 하는 사람이 멋져 보였고, 공부에 미련이 남아서 언젠가 석사를 하러 돌아올 것 같다는 생각이 들었습니다.나이 먹고 돌아올 바에는 두려울 것이 없는 나이에 후회없이 도전해보고 싶었습니다. 대학원 생활에는 희노애락이 참 가득했습니다... 1학년 1학기기본적인 프로그래밍, 인공지능 개념, 수학 이론 등에 대해서 공부하는 시간을 가졌어요.생각해보면 ..
https://arxiv.org/pdf/2304.00685 초록(abstract)대부분의 시각 인식 연구는 딥 뉴럴 네트워크(DNN) 훈련에서 군중이 라벨링한 데이터에 크게 의존하며, 각각의 시각 인식 작업에 대해 DNN을 훈련시키는 경우가 많아 매우 번거롭고 시간이 많이 소요되는 시각 인식 패러다임을 형성하게 됩니다. 이러한 두 가지 문제를 해결하기 위해, 최근에는 웹 스케일 이미지-텍스트 쌍에서 풍부한 시각-언어 상관관계를 학습하고, 단일 Vision-Language Model(VLM)로 다양한 시각 인식 작업에 대한 제로샷 예측을 가능하게 하는 VLM이 집중적으로 연구되고 있습니다. 본 논문은 다양한 시각 인식 작업을 위한 VLM에 대한 체계적인 리뷰를 제공합니다. 리뷰 내용은 다음과 같습니다:시..
“Be skeptical. But when you get proof, accept proof.” – Michael Specter“의심해 보세요. 하지만 증거를 얻으면 증거를 받아들이십시오.” – 마이클 스펙터 문제에 대한 확실한 증거를 얻으려면 어떻게 해야 할까? 그건 바로 '논문' 그렇지만 논문을 읽고 이해하는 것에도 기술이 필요하다는 것 그래서 쓰게 된 글 시작하기 전: 몇 가지 조언과학 논문을 읽는 것은 블로그, 신문 기사를 읽는 것과는 완전히 다르다.제시된 순서와 다른 순서로 섹션을 읽어야 한다.메모하며 여러 차례 읽어야 한다.세부 내용에 대해 다른 문서를 찾아봐야 할 수도 있다.처음에는 하나의 논문을 읽는 데 오랜 시간이 걸릴테지만, 경험이 쌓이면 점차 빨라질 것이다. 읽기 전 [ 저..
티스토리 단점개인적으로 티스토리는 개발자나 연구자 입장에서 편리한 블로그는 아니라고 생각한다.상단 메뉴바에 수식 넣는 기능이 없다.상단 메뉴바를 이용하면 목록을 1개만 넣을 수 있다. 계층으로 넣는 건 불가능하다.마크다운 문법이 완전하지 않아서 적용되지 않는 부분도 있다.그렇다고 이제 와서 모든 글을 velog로 옮길 수도 없는 노릇...그래서 내가 결론내린 방식은 다음과 같다. 수식이 들어간 티스토리 글 작성 방법일단 아래의 설정을 한다.글 작성 시 마크다운&Latex으로 작성한다.NOTION 등의 마크다운 편집기에서 적어서 복붙한다. (티스토리는 마크다운 쓰기 적합하지 않음)미리보기를 눌러서 제대로 작성되고 있는지 수시로 확인 (티스토리 불안정해서 이상하게 적힐 때 있음)완⭐성 설정티스토리 관리 ..
Swin Transformer 개요기존의 한계언어와 비전, 두 Modality 간의 차이스케일- 언어와 달리 이미지에는 다양한 '물체의 크기' 요소가 존재해상도- 단어로 구성된 문장은 그 길이가 상대적으로 짧음, 반면 이미지는 비교적 높은 해상도를 가짐- 세밀한 예측이 필요한 Sementic segmentation 등의 다양한 비전 task 존재- Self-attention 계산 복잡도가 이미지 크기의 제곱에 비례하므로 고해상도 이미지 처리는 어려움이러한 문제를 극복하기 위해 Swin Transformer 제안- 이미지 분류, Object Deteciton, Sementic Segmentation 등의 범용 Backbone으로 사용할 수 있음 의의(자세한 내용은 아래 구조에 대한 설명에서 더 자세하게 ..
ViT 개요의의ViT는 Transformer 인코더를 크게 변경하지 않고 이미지 처리에 적용- 기존: Attention 기법을 사용할 때 CNN과 함께 사용하거나, CNN 구조를 유지하면서 CNN 특정 구성 요소 대체에 사용- Attention만을 사용한 모델도 있었지만 CNN 기반 모델의 성능을 넘기지 못함ViT에서는 Transformer만으로 CNN 기반 모델의 성능을 뛰어넘음 장단점장점확장성이 좋다.- Tansformer 구조를 거의 그대로 사용하기 때문- 기존 Attention 기반 모델은 이론적으로 뛰어나지만, 특성화된 Attention 패턴으로 다른 네트워크에 확장하기 어려웠음Large Scale 학습에 우수하다.- Transformer의 장점을 그대로 흡수전이학습 시에 CNN보다 학습에 적은..