Labels
- active matter
- analog computing
- codes
- complex networks
- graph theory
- information geometry
- information theory
- linear algebra
- logic
- machine learning
- my research life
- non-equilibrium statistical physics
- nonlinear dynamics
- optimal transport
- physics_general
- probability
- quantum thermodynamics
- Science of semantics
- soft matter
- statistical physics
- statistics
게시물 목록
Thursday, May 8, 2025
2025-04-23 한국물리학회 봄학술대회 (대전) 참석 후기
Thursday, April 3, 2025
이항 관계(Binary relations)의 개념과 몇 가지 성질
어떤 집합 \(A\)에서 정의되는 이항 관계(binary relation), 혹은 단순히 관계(relation) \(\mathrm{R}\)는, 그 집합의 원소들의 순서쌍 \((x,y)\)들을 원소로 갖는 어떤 집합이다.
이런 것을 왜 정의하는가? 일상 언어에서의 '관계가 있다'라는 말을 집합의 언어로 형식화한다고 생각하면 이해가 쉽다. 세 원소 \(a,b,c \in A\) 가 만드는 순서쌍 중, 예를 들어서 \((a,b)\)는 특정한 관계를 만족하지만, \((a,c)\)는 그러한 관계를 만족하지 않는 상황을 얼마든지 생각할 수 있다. 이를 \((a,b)\in\mathrm{R}\), \((a,c)\notin\mathrm{R}\)로 하여, '관계를 만족한다(만족하지 않는다)'는 것을 '집합 \(\mathrm{R}\)의 원소이다(원소가 아니다)'라고 형식화하는 것이다.
이때 이항 관계 \(\mathrm{R}\)에 별다른 조건은 없다. 즉 사람 눈으로 보기에 이게 정확히 어떤 관계인지 의미를 부여하기 어렵더라도 상관이 없다. 마치 함수(실제로 이항 관계는 함수의 일반화이다)가 반드시 우리가 아는 어떤 식 \(f(\cdot)\)를 이용하여 \(y=f(x)\) 꼴로 간결하게 나타내어지거나 일상 언어로 의미가 부여될 필요는 없는 것과 같다.
이를 간단히 \(a\mathrm{R}b\)라고 표기하기도 한다. 이렇게 표기하면 상당히 생소해 보이지만, 결국 집합에 대한 이야기이므로 너무 낯설어하지 않아도 되며, 공부하다가 확실하지 않은 것은 집합의 언어로 풀어 쓰면서 확인하고 이해해 볼 수 있다. 그렇지만 이항 관계들을 능숙하게 다루기 위해서는 그렇게 매번 집합의 언어로 바꾸어서 다루기보다는, 이항 관계의 주요 성질들을 숙지한 뒤 \(a\mathrm{R}b\)와 같은 표기법을 바탕으로 다룰 줄 아는 것도 필요할테다.
이하에서는 주어진 이항 관계가 만족하거나 만족하지 않는 몇 가지 주요 성질들(비대칭성, (비)반사성, 반대칭성 등)을 소개하고, 집합과 논리를 연습할 겸 간단한 정리 1개의 증명을 다룬다.
1. 비대칭성(asymmetry)
\[\forall x,y \in A,\, (x,y)\in\mathrm{R} \Rightarrow (y,x)\notin\mathrm{R}.\]
이항관계 \(\mathrm{R}\)이 비대칭적(asymmetric)이라는 것은, \((x,y)\)가 그 관계를 만족할 경우 이것을 뒤집은 \((y,x)\)는 그 관계를 만족하지 않는다는 뜻이다. 집합의 원소를 점으로 표현하고 관계를 화살표로 표현하면, 이를 어떤 두 점 사이에도 화살표가 한 방향으로만 있어야 한다(혹은 아예 없거나)고 말할 수 있다. 그림을 통한 이해는 최하단 사진에서 볼 수 있다.
2. 반사성(reflexive)와 비반사성(irreflexive)
(1) 반사성
\[\forall a\in A, (a,a)\in\mathrm{R}.\]
이항관계 \(\mathrm{R}\)이 반사적이라는 말의 정의는, \(A\)의 모든 원소 \(a\)에 대해 \(a\)에서 출발해서 바로 자기 자신으로 돌아가는 화살표가 있어야 한다는 것이다 (여러 점을 거쳐서 다시 들어가는 것은 가능하다. 이항(binary), 즉 두 원소 사이의 관계이므로 이런 것은 고려의 대상이 아니다).
(2) 비반사성
\[\forall a\in A, (a,a)\notin\mathrm{R}.\]
이항관계 \(\mathrm{R}\)이 비반사적이라는 것은, \(A\)의 어떤 원소 \(a\)에 대해서도, \(a\)에서 출발해서 바로 자기 자신으로 돌아가는 화살표가 없어야 한다는 뜻이다. 이러한 비반사성은 단순히 '반사적이지 않다'는 것과는 다르다.
3. 반대칭성(antisymmetry)
\[\forall x,y\in A, \quad (x,y)\,\mathrm{and}\,(y,x)\in\mathrm{R}\,\,\Rightarrow\,\, x=y.\]
이항관계 \(\mathrm{R}\)이 반대칭적(antisymmetric)이라는 것은, 두 순서쌍 \((x,y),(y,x)\)가 모두 \(\mathrm{R}\)을 만족하는 경우는 \(x,y\)가 사실 같은 원소인 경우뿐이라는 뜻이다. 이를 반대로 생각하면(대우명제) 더 쉬운데, \(x,y\)가 다른 원소일 경우에는 양쪽 화살표 둘 모두가 존재해서는 안 되고, 한쪽만 있거나 아예 없어야 한다는 뜻이다. 자기 자신에서 나와서 자기 자신으로 들어가는 화살표는 가능하다.
이상의 정의로부터, 어떤 이항관계가 반대칭인데, 자기 자신에서 나와서 자기 자신으로 들어가는 화살표까지 없으면, 그 이항관계는 비대칭이라는 것은 직관에 따라 비교적 명확하다. 실제로 다음이 성립한다. 즉 비대칭성과, '반대칭성 & 비반사성'은 서로 필요충분조건이다.
\[\textrm{R is asymmetric}\,\,\Leftrightarrow\,\,\textrm{R is irreflexive and antisymmetric}\]
이를 집합의 언어로 증명해 보자. 증명 과정을 명료하게 써 보는 일, 그러면서도 그림을 통한 직관적인 이해와 align시켜 보는 일은 생각보다 재미있다.
① \((\Rightarrow)\)
i) asymmetric \(\Rightarrow\) irreflexive
이항관계 \(\mathrm{R}\)이 비대칭일 때,
만약 어떤 \(a_1,a_2\in A\)가 존재하여 \(a_1=a_2\,(=a)\)이고 \((a_1,a_2)\in\mathrm{R}\)이라면 (가정)
비대칭성의 정의에 의하여, 순서를 바꾼 순서쌍 \((a_2,a_1)\) 은 \(\mathrm{R}\)의 원소가 아니다.
그러나 \(a_1=a_2\)이므로 실제로는 이는 원래 순서쌍과 동일하며 따라서 \(\mathrm{R}\)의 원소여야 한다는 결론이 나온다. 이는 모순이다. 따라서 가정은 잘못되었다.
즉, 어떠한 \(a\in A\)에 대해서도 \((a,a)\notin\mathrm{R}\)이다. 곧, \(\mathrm{R}\)은 비반사적이다.
ii) asymmetric \(\Rightarrow\) antisymmetric
이항관계 \(\mathrm{R}\)이 비대칭일 때,
\((x,y)\in\mathrm{R}\,\,\Rightarrow\,\,(y,x)\notin\mathrm{R}\)이므로,
반대칭 여부를 판단하기 위한 조건인 \((x,y)\,\mathrm{and}\,(y,x)\,\in\mathrm{R}\)을 만족하는 순서쌍 자체가 존재하지 않는다. 따라서 \(x=y\)는 vacuously true이다. 곧, \(\mathrm{R}\)은 반대칭이다.
② \((\Leftarrow)\)
이항관계 \(\mathrm{R}\)이 비반사적이고 반대칭일 때,
만약 어떤 \((x,y)\in\mathrm{R}\)에 대해 \((y,x)\in\mathrm{R}\)이라면 (가정)
\(x,y\)의 관계는 같거나 다르거나 둘 중 하나인데,
\(x=y\)라면 \((x,x)\in\mathrm{R}\)이므로 비반사성에 모순이고,
\(x\neq y\)라면, \((x,y)\,\mathrm{and}\,(y,x)\,\in\mathrm{R}\)인데 \(x\neq y\)이므로 반대칭성에 모순이다.
따라서 어떤 경우에도 가정은 잘못되었다.
즉 모든 \((x,y)\in\mathrm{R}\)에 대해 \((y,x)\notin\mathrm{R}\)이다. 곧, \(\mathrm{R}\)은 비대칭이다.
①, ②를 종합하면, 증명하고자 했던 정리가 참임을 알 수 있다.
Facebook에서 이 글 보기: 링크
- 끝 -
Tuesday, March 11, 2025
딥러닝의 일반화 성능에서 'flat minima' 테제의 역사 (history of 'flat minima' argument on the generalization performance of deep learning)
뉴럴 네트워크가 지극히 성공적인 이유를 설명할 때 주로 핵심이 되는 키워드는 일반화(generalization)이다. 일반화란 주어진 데이터에 과적합(overfitting)되지 않고 새로운 샘플들이 들어와도 좋은 성능을 내는 능력을 말한다. 이는 모델의 단순성(simplicity)과도 어느 정도 관련된다. 모델이 지나치게 복잡하면 training set은 아주 잘 맞출 수 있겠지만, (동일한 가상의 분포로부터 왔다고 간주되는) 새롭게 주어지는 test set은 잘 맞추지 못하게 되기 때문이다.
문헌들에서는 딥러닝이 이러한 높은 일반화 성능을 보여주는 이유가, loss function landscape의 flat minima와 거의 동일시되는 경우가 많다. 뉴럴 네트워크의 가중치들이 SGD와 같은 최적화 과정을 통해 도달한 지점이, 뾰족하지 않고 널찍한 곳일 때에 일반화를 잘 한다는 것이다.
SGD를 포함한 표준적인 딥러닝 학습 알고리즘의 recipe가 신경망 가중치들로 하여금 왜 이러한 flat minima를 선호하게 되는지, 혹은 표준적인 recipe를 어떻게 수정해서 flat minima를 일부러 더 선호하게 할지에 대해서, 비평형 통계물리학을 포함한 다양한 관점에서의 많은 연구가 존재한다.
그런데 더 기본으로 돌아가서, 이러한 flat minima가 일반화 성능과 동일시될 수 있는 이유는 정확히 무엇인가? 근래의 딥러닝 논문들에서 이 주장을 정당화할 때, loss landscape가 조금 뒤틀어져도 (즉, 데이터셋이 조금 바뀌어도) 모델의 특성이 크게 바뀌는 게 없어서라고 직관적으로만 주로 설명한다. 이는 설득력이 있으며 일반적으로 널리 받아들여진다. 그러나 정말로 그러한지, 그리고 이론적으로는 어떻게 설명할 수 있는지는 별개의 문제이다. 이에 문헌 조사를 해 보았다.
[1] S. Hochreiter and J. Schmidhuber, "Simplifying neural nets by discovering flat minima," NIPS 1994.
[2] S. Hochreiter and J. Schmidhuber, "Flat minimum search finds simple nets," Technische Universität München Technical report FKI-200-94, 1994.
[3] S. Hochreiter and J. Schmidhuber, "Flat minima," Neural Computation 9(1), 1997.
Tuesday, January 14, 2025
Sanaka AI의 swarm intelligence와 AI Scientist의 관계가 그 윤곽을 드러내다
Sanaka AI는 자연-모방 계산(nature-inspired computing), 무리짓는 지능(swarm intelligence) 등을 테마로 해서 창업된 회사이다. 이 테마는 silicon photonics, reservoir computing, probabilistic 및 thermodynamic computing 등과 함께 비전형적(unconventional) 컴퓨팅, 그 중에서도 analog computing의 한 종류에 잠재적으로 해당할 수 있다.
Thursday, November 21, 2024
복잡계 분야 윤혜진 교수님의 서울대 경영대 부임 소식
우리 교수님의 교수님이신 정하웅 교수님의 또다른 박사 제자이신 윤혜진 교수님(켈로그 스쿨)께서 이번에 서울대학교 경영대학으로 옮겨 오셨다는 소식(링크)이다. 부임한 지 얼마 안 되셔서 바쁘시겠지만 우리 연구실에도 초청 강연을 추진해 보면 좋겠다.
복잡계물리 쪽 연구방법론으로 인문사회 쪽 전공에 임용되신 또다른 경우로는 서울대 사회학과 손윤규 교수님이 계시며, 융합적인 전공에서 데이터 기반으로 인문사회학적 문제를 연구하시는 분들로 넓혀 보면 경희대학교 육순형 교수님, 숭실대학교 윤진혁 교수님 등 더욱 많이 계신다.
Facebook에서 이 글 보기: 링크
Tuesday, October 8, 2024
2024년 노벨물리학상 및 노벨화학상에 대한 단상들
2024.10.08.
올해 노벨물리학상은 굉장한 화제와 논란을 낳고 있는데 개인적으로는 매우 환영하는 바이며 전혀 이상하지 않게 느껴진다. 수상자 중에 제프리 힌튼(Geoffrey Hinton)이야 딥러닝 분야의 최고 기여자로 늘 세 손가락 안에 꼽힐 정도로 유명하고, 또다른 수상자인 존 홉필드(J. J. Hopfield)가 어떤 분인지에 대해서는 마침 작년에 썼던 글이 있어서 공유해본다 (게시물: 링크).
나야 무척 환영이지만 논쟁적인 수상이긴 할 것 같기는 한데, 심지어 물리학을 공부하는 대학원생들 중에서도 순수물리학이 아닌 인공지능 분야가 노벨물리학상을 받았다며 비꼬거나 부정적으로 보는 분들이 많이 있는 걸 보면 분위기가 별로 좋지만은 않은 듯하다.
먼저 사람들이 크게 오해하고 있는 부분은, AI가 성공하고 나니까 물리학이 뒤늦게 숟가락을 얹어서 시상을 했다는 생각이다. 힌튼은 또 몰라도, 홉필드의 경우 신경망 연구를 하긴 했지만 그 때나 지금이나 완전히 물리학자였고, 그 신경망 연구도 명백한 물리학의 한 분야로 인식되고 연구된 것이니, 충분히 물리학상에 worth하다고 생각하긴 한다.
게다가 홉필드만 일탈적으로 그런 연구를 한게 아니라 한국을 포함한 수많은 나라의 물리학자들이 당시에 신경망 학습 연구를 했다. 과거에 트랜지스터도 물리학자들이 발명한 뒤에 공학자들에 의해 미세화되면서 전기전자공학을 뒤집어 놓은 건데, 첫 발명자인 물리학자들이 노벨 물리학상을 받은것에 사람들이 큰 이의는 없듯이... 인공지능도 전혀 다르지 않은데 사람들이 잘 몰라주는 듯해서 아쉽다.
수차례 언급했듯이 딥러닝의 기초 원리(뿐만 아니라 self-supervised learning, transfer learning 등을 비롯한 상당수의 현대적 학습기법까지)는 인공신경망에 있어서 비선형 신경 동역학 관점의 간접화, 역전파법의 적용, 연산방법 혁신 및 하드웨어 연산량의 증대 등을 거쳐서, 딥러닝이 현실화되기 한참 전인 90년대경에 상당부분 수립되어 있었다. 그리고 그것을 주도한 것은 주로 패턴 기억과 재현에 관심을 가진 통계물리학자, 신경생물학자, 컴퓨터과학자들이기도 했다. 2012년 ImageNet을 계기로 딥러닝이 실현가능한 영역에 들어온 이후의 주요 발명 중에, 내가 아는 한에서 정말로 많이 새롭다고 할수 있는건 어텐션과 트랜스포머 정도일 것 같다.
Wednesday, September 18, 2024
Simple script for solving matrix equations via Mathematica
Friday, August 9, 2024
지중해의 휴양지, 코르시카 꺄흐제즈(Cargèse) 여름 학교에 가다!
Monday, July 1, 2024
뜻밖에 마주한 앨런 소칼의 이름
8월에 있는 세미나를 준비하기 위해 우리 비평형 통계물리학 분야의 논문(M. Esposito and M. Polettini, "Effective thermodynamics for a marginal observer," Phys. Rev. Lett. 119 (2017))을 읽고 있는데, 참고문헌에 '지적 사기'로 유명한 앨런 소칼(Alan D. Sokal, 위키백과 문서: 링크)의 이름이 있어서 뜻밖의 조우에 반가움을 느꼈다.
커리어 대부분 미국에서 훈련받고 재직했지만 2006년부터는 영국 UCL에 재직 중이고 현재도 꽤 활발하게 전공분야 논문이 출판되고 있다. 수리물리학을 다루는 데 있어서 수학과랑 물리학과의 구분이 유난히 흐린 편인 영국 학계 특유의 색깔에 굉장히 잘 어울리는 연구 스타일을 가진 분인 듯하다.
Facebook에서 이 글 보기: 링크
Wednesday, June 12, 2024
딥러닝 학습기법 개선 연구의 두 방향: 클래스를 확장하기, 한정시킴으로써 정당화하기
딥 러닝을 이론적으로 분석하거나 개선할 때 그 원리적인 부분에 집중해서 end to end rigor를 추구하는 것은 이론학도의 입장에서 지적으로 무척 재미있고 자연스럽지만 사실 끝이 없는 일이다. 뉴럴 네트워크라는 시스템과 그 동역학은 워낙에 여러 관점, 여러 공간에서 볼 수가 있다 보니, 애초에 표준적인 단일한 관점이 없기도 하고 말이다.
그렇다 보니 end to end 정당화는 안 되더라도, 특정 레벨, 특정 스페이스에서 직관을 바탕으로 해서 다양한 타 분야의 아이디어를 접목해서 성능 개선을 했다는 논문이 꽤 많다. 이런 점에서 퀀트 쪽이랑 좀 비슷한 것 같다는 생각이 문득 들었다. 핵심 아이디어 부분의 작용 원리가 사람에게 설득이 되고 실제 성능도 좋다면, 그 아이디어가 딥러닝의 전체 과정에 다소간에 덕지덕지 결합해 있더라도 긍정적으로 받아들여지는 그런 느낌에서 말이다. 딥러닝이 아니더라도 여러 가지 최첨단 공학의 산물들이 그렇게 덕지덕지 되어 있는 경우가 많으니 이것은 특별히 이상한 것은 아니다.
근데 문제는 딥러닝에서는 그렇게 창의적으로 제안된 학습 방법 혹은 아키텍쳐들이, 특정한 세팅 하에서의 작은 모델에서는 잘 validate될지언정 large scale에서의 보편적 실증은 잘 안 될 수가 있다는 점이다. 내가 배움이 부족하다 보니 이런 일의 전모와 잘 대응이 되는 말인지는 모르겠으나, inductive bias라는 키워드도 관련이 되는 것 같고 말이다.
일례로 트랜스포머의 온갖 마이너한 개선들이 있지만 그 중에 아직까지도 vanilla한 아키텍쳐와 셀프-어텐션 메커니즘을 large model에서 근본적으로 넘어서는 게 아직 없는 것 같다고 듣기도 했다. 물론 이것은 트랜스포머가 특히 처음부터 너무 잘 만들어져서 더 그런 것 같긴 한데... 아무튼 마침 오늘이 그 유명한 'Attention is all you need' 논문(NeurIPS 웹사이트에서 논문 보기: 링크, 구글 스콜라 기준 2024.06.13일자로 확인되는 인용 수 124195회)이 처음 나온지 딱 7년 되는 날이라 이 얘기도 적어 둔다.
그렇다면 위와 같은 창의적인 아키텍쳐 및 학습기법 연구들이 더 잘 정당화되려면 어떤 방향의 보완이 필요할까? 자신의 아이디어를 딥러닝의 end to end rigor 속에 구겨넣고 이론적으로 해석해서 더 엄밀하게 입증해야 하나? 물론 그렇게 된다면 너무 아름답고 좋은 논문이겠지만, 직관에 근거하여 창의적으로 제시된 practical한 개선 방법일수록 그렇게 하기가 어렵다.
애초부터 그렇게 구겨넣을 필요가 없게, vanilla한 기법의 내부 원리와 자연스럽게 융화하도록 아름답게 원리적 개선을 꾀한 연구들은 참 흔치가 않다. 그런 연구들은 특유의 스타일이 있는데, 기존의 모델이 알고 보니 더 넓은 클래스의 모델들의 한쪽 끝에 불과하다는 것을 알아내고, (억지스럽지 않게 정의되며 기존에도 성질이 잘 알려진) 그 넓은 클래스 안에서 제일 좋은 모델을 찾는 식의 접근을 대개 취하는 듯하다.
한편 자신의 아이디어가 분명히 성능은 좋지만 위와 같은 방식으로 정당화되기는 어려운 성격의 것이라면, 토이 데이터셋 말고 현실적인 커다란 과제에서도 보편적으로 성공적인지를 따져 보면 된다. 그러나 위에서 언급했듯이 그렇게 scale up된 검증을 통과하는 연구는 전체 연구의 개수에 비해서는 많지 않을 것으로 짐작된다. 결국 자신이 제안한 기법이 어떤 종류의 문제에 대해, 어떤 학습 상황에서 얼마나 성공적인지를 스스로 끊임없이 의심해 가며 명확히 밝혀서, '한정시킴으로써 정당화'해야 할 것으로 보인다.
자랑하자면 우리 연구실에서 나온 논문 중에도 위의 두 요건을 모두 만족하는 접근을 취한 것이 있다 (Euijoon Kwon and Yongjoo Baek, "
Facebook에서 이 글 보기: 링크

