게시물 목록

Showing posts with label statistical physics. Show all posts
Showing posts with label statistical physics. Show all posts

Sunday, November 23, 2025

[Deepest S18 Seminar] Geometry of solution space: Flat minima, replica theory and mode connectivity

    Last Saturday, I hosted a seminar at Deepest (an SNU student deep learning club). I mainly focused on theoretical topics related to the loss function landscape in deep learning and the concept of flat minima, and briefly covered some additional topics on global geometry.





    The loss function \(L\left(\theta; \{x_\mu\}_{\mu=1}^P\right)\) is a function of numerous weights \(\theta$\) of a neural network, and the "landscape" of this function is determined by the dataset \(\{x_\mu\}_{\mu=1}^{P}\). S. Hochreiter proposed that, models that lie in 'flat minima' of the landscape generalize better (S. Hochreiter and J. Schmidhuber, NIPS (currently NeurIPS) 1994).

    The geometric intuition supporting this argument is simple: in order to make the loss landscape not distorted too much under a dataset change (training set -> test set), the model should lie on a broad region of the loss. This also agrees with the discussion on model complexity in the context of statistics and information theory, which says that simple models generalize better (ICLR 1995).

    In fact, one can show that maximum a posteriori (MAP) inference is equivalent to the minimization of cross-entropy loss while keeping the model simple (L2 regularization when \(-\ln P(\theta)\propto \theta^{2}\)). This is exactly what we do at deep learning. Moreover, this is also equivalent to the idea of minimum description length (MDL), which states that the total number of bits needed to identify the model and data should be as small as possible.

    The authors show that finding flat minima (whose loss values of the neighborhood are similar across as large as possible volume) is also linked to MDL. They further suggest a gradient descent method which is intentionally biased to prefer that kind of minima, which leads to good generalization.

    Research on flat minima is still continued in contemporary deep learning era. Nowadays it is widely accepted that, SGD natively prefers flat minima without adding any bias. There are also a few works rigorously connecting flat minima with generalization performance based on the PAC-Bayes framework.

    Another active line of research analyzes the global geometry of the disordered solution space of deep learning using statistical physics (E Gardner, J. Phys. A: Math. Gen. (1988)). They start from a simple perceptron model with random data, but they have been extended to more realistic architectures and datasets. In this paradigm, the frequently appearing factor \(\alpha=P/N\) (\(P\): data size, \(N\): model size) is crucial for the collective behavior of the neural network. For example, for random dataset, when α is small (large), the space of solutions tends to be connected (fragmented), which can be roughly related to flat minima. Moreover, at the limit where \(\alpha\) is finite but \(N,P\) goes to infinite, an accurate explicit formula of train loss for practical dataset (MNIST, etc.) is obtained.

    Lastly, this method can theoretically reproduce the renowned '(linear) mode connectivity' (PRL 2023) which is empirically reported in deep learning at the late 2010s, and furthermore predict that the structure of the connected region is star-shaped.

See this post on LinkedIn: link

See this post on Facebook: link


(국문)

    지난 11월 15일(토요일)에 서울대학교 딥러닝 동아리 Deepest에서 세미나를 호스팅했습니다. 딥러닝의 손실함수(loss function) 지형과 flat minima에 대한 이론적 주제를 자세히 다루었고, 보다 광역적인 구조에 대한 몇 가지 추가 주제도 소개하였습니다.

    손실함수 \(L\left(\theta; \{x_\mu\}_{\mu=1}^P\right)\)는 신경망 연결의 수많은 가중치 \(\theta\)를 정의역으로 갖고, 이 함수의 모양, 즉 "지형"(landscape)은 데이터셋 \(\{x_\mu\}_{\mu=1}^{P}\)에 따라 다르게 결정됩니다. 손실함수 지형 위의 한 점을 선택하는 것은, 신경망 가중치들이 확정되므로 모델을 확정하는 것과 같습니다. 대표적인 시계열 처리 모델인 LSTM의 제안자이기도 한 Sepp Hochreiter는 NIPS (현 NeurIPS) 1994에서, 손실함수 지형의 flat minima (평탄한 최소점) 에 위치한 모델이 일반화(generalization) 성능이 좋을 것이라고 제안하였습니다 (S. Hochreiter and J. Schmidhuber, NIPS 1994).

    이 논의의 근거가 되는 기하학적 직관은 간단합니다. 데이터셋이 training set에서 test set으로 바뀔 때에 그럼에도 불구하고 손실함수 지형이 덜 뒤틀리려면, 따라서 원래 모델에서 평가되었던 손실함수 값이 많이 바뀌지 않으려면 (즉 일반화를 잘 하려면) 모델은 지형의 널찍한 영역에 있어야 한다는 것입니다. 아래에서 MDL 개념을 바탕으로 보다 자세히 쓰겠지만, 이는 통계학 및 정보이론에서 model complexity와 관련하여 논의된, '단순한 모델일수록 일반화를 잘 한다'는 논의와도 일관적입니다 (J. Schmidhuber, ICLR 1995).

    베이즈 추론 맥락에서 최대사후확률(maximum a posteriori, MAP) 추론이, cross-entropy loss를 최소화하면서도 모형을 간단하게 유지하는 것(\(-\ln P(\theta)\propto \theta^{2}\)일 때 L2 regularization)과 동등합니다. 이것은 다름이 아니라 딥러닝에서 우리가 많이 하는 일입니다. 상상 속에 존재하는 매끄러운 data distribution과 달리 실제로 기계에게 주어지는 것은 개별적인 샘플들(즉 델타함수 분포)뿐임을 고려하면, 이렇게 simple model을 추구하는 것은 일반화에 매우 중요하다고 하겠습니다. 그런데 더 나아가서, 이것은 모형을 고르는 원리 중의 하나인 miminum description length (MDL), 즉 모델과 데이터를 기술하기 위한 비트 수의 총량이 가능한 한 작아야 한다는 원리와도 동치입니다.

    저자들은 flat minima를 찾는 것, 즉 최소점 중에서 그 주변에 자기 자신과 같은 loss 값을 갖는 점들의 부피가 가능한 한 많은 최소점을 찾는 것 역시 MDL과 관련됨을 보입니다. 더 나아가서, 그러한 minima를 선호하도록 의도적으로 bias된 새로운 gradient descent 방법을 제안하고 이를 통해 일반화를 잘 하는 모델을 찾을 수 있다는 것을 확인합니다.

    Flat minima와 관련된 연구는 딥 러닝이 정보기술의 전면에 등장한 현대에도 계속되고 있습니다. 최근에는 SGD가 별도의 의도적인 편향 없이도 그 특유의 통계학적, 동역학적 특성에 의해 native하게 flat minima를 선호하는 경향이 있다는 것이 상당히 널리 받아들여집니다. SGD는 단순히 batch size를 줄여서 최적화 과정을 효율화할 뿐 아니라, 그 결과로 보다 더 좋은 minima에 도달할 수 있게 해 준다는 것입니다. 최근에는 flat minima와 일반화 성능을 PAC-Bayes 프레임워크를 이용해서 보다 엄밀하게 연관짓는 일들도 있습니다.

    전통이 있으면서 현재까지도 활발한 또다른 연구의 흐름은, 딥 러닝의 무질서한(disordered) 해 공간의 광역적 구조를 통계역학을 이용해서 분석하는 것입니다 (E Gardner, J. Phys. A: Math. Gen. (1988)). 이러한 이론적 연구들은 주로 간단한 단일 퍼셉트론 및 랜덤 데이터셋과 같은 간단한 상황에서 출발했지만, 점점 보다 복잡하고 사실적인 상황들에 대해 적용되며 딥러닝에서 나타나는 현상을 상당히 잘 설명해냅니다. 이 패러다임에서는 \(\alpha=P/N\)라는 팩터(\(P\): 데이터셋 크기, \(N\): 모델 크기)가 자주 중요하게 등장합니다. 특히 \(\alpha\)를 유한하게 유지하되 \(N,P\) 모두 무한대로 보내는 극한에서 (수백~수천 차원에서 이미 실제 실험 결과들과도 꽤 잘 맞는 경우가 많습니다) 신경망의 많은 중요한 성질이 통계역학적으로 예측됩니다.

    이를테면, 랜덤 데이터셋에서, \(\alpha\)가 작을수록 퍼셉트론 분류 문제의 해들(보다 사실적인 신경망에서는 region with low loss)들이 서로 연결된 경향이 있고, \(\alpha\)가 클수록 해들이 쪼개져 있는(fragmented) 경향이 있습니다. 이는 통계역학 맥락에서 각각 replica symmetry (RS) 및 그 breaking (RSB)에 대응됩니다. Flat minima와의 관계도 생각해 볼 수 있습니다. 물론 flat minima는 국소적인 개념이고 RS/RSB는 훨씬 광역적인 개념이므로 일대일 대응시키기는 어렵지만, rough한 관계는 있을 것이라고 기대하고 Franz-Parisi entropy 등을 통해 보다 광범위하게 확인해야 할 것입니다.

    마지막으로, 이 통계역학적 방법은 2010년대 후반부터 딥 러닝 이론 커뮤니티에서 경험적으로 많이 보고된 '(linear) mode connectivity'를 이론적으로 재현해내기도 합니다. 이는 손실함수 지형 상에서 작은 loss 값을 갖는 영역들이 평평한 직선 경로를 통해 매우 넓게 연결되어 있다는 관찰을 뜻합니다. 그리고 나아가서, 이러한 연결 구조가 별 모양이라는 새로운 이론적 예측도 하며 (B. L. Annesi et al., PRL 2023), 이러한 예측을 보다 실제적인 신경망에서 확인하려는 시도도 이어지고 있습니다.

Wednesday, August 27, 2025

한국연구재단 박사과정생연구장려금 선발 소식

이번 한국연구재단 박사과정생연구장려금(1년형) 지원사업에 <비평형계에서 확률적 정보 흐름의 정량화 및 활용>이라는 주제로 지원하여 선정되었다. 대학원생 신분으로 연구책임자가 되어 연구비를 직접 집행해 볼 수 있는 몇 안되는 기회인 것 같고, 연구계획서 작성하는 과정 자체도 많이 도움이 되었다.



너무 거창한 비전보다는 실제로 내가 쌓아올리고 있던 연구 계획과 그 기대 효과를 바탕으로 썼기 때문에 실현 가능성에서 좋은 평가를 받은 것 같고, 사업 특성상 학위연구목표 및 진로계획과의 연계가 충분히 구체적인지도 평가를 받지 않았을까 싶다. 물론 열심히 쓰기도 썼지만 이번에 선발과제 수를 1,200개 내외로 예년보다 크게 늘린 덕에 운이 좋기도 했을 듯하다.

이번 연구는 능동물질을 비롯한 미시적 기계들에서 나타나는 이례적인 집단 현상들을 열역학 제2법칙이 '국소적으로' 위반되는 것으로 보고, 큰 편차 이론(large deviation theory)을 통해 그 위반을 증폭시키거나 약화시켜 보면서 제2법칙 위반의 동역학적 구조를 체계적으로 탐색하고자 하는 연구이다. 하고자 하는 일은 꽤 명료하지만 왜인지 기존에 직접 시도된 바는 많지 않다.

직접 쌓아올려 애정을 가진 주제를 내 이름 앞으로 된 연구과제를 통해 수행해 볼 수 있어서 기쁘면서도 어깨가 무겁다. 연구 장비 구입, 인건비, 학술교류 참석 및 진행 등을 과제 취지에 맞게 잘 집행하면서, 연구 프로세스가 1년간 계획대로 잘 이루어질 수 있게 해야겠다.

Facebook에서 이 글 보기: 링크

Sunday, July 6, 2025

[presentation material] Statistical physics approaches to deep learning: dynamical and structural perspectives

Recently I joined an interdisciplinary study group called the 'TMI group', which consists of students from various backgrounds including AI, neuroscience, physics, education studies and philosophy. This group is one of the most enthusiastic study groups I have ever attended, providing actually productive discussions and critical issues.


Last week, I hosted a zoom seminar for this group titled 'Statistical-physics approaches to deep learning: dynamical and structural perspectives (DL x SP)'. I aimed to convey that deep learning can be understood as a 'non-linear many-body system with non-deterministic dynamics', therefore being a legitimate topic of SP.


Even within SP, there are many incommensurable views for the analysis of DL. Some are indeed useful but relatively phenomenological, while others fundamentally tackle the structural aspects of DNNs. Recently, I believe 'disorder' is the most central concept of the SP view of DL.


NNs are highly complex, since they are non-linear combinations of functions with vastly different weights. But they are distinguishable from completely random fields since they learn something and form good representations. They are indeed complex, but they are somehow 'structured' and (especially thanks to the fact that they involves super high-dimensional space) the situation is not so bad.


This subtle regime is effectively tackled by theories developed for disordered systems including replica method. These calculations have been successfully connected to actually important concepts in DL community, such as lazy (kernel) learning versus feature learning, flat minima, linear mode connectivity (for example, see B. L. Annesi et al., "Star-shaped space of solutions of the spherical negative perceptron," Physical Review Letters 131 (2023)).


In fact, this perspective traces back to the ancient era of deep learning. Even at the 1980s and 90s, statistical physicists have focused on analyzing the phase behavior during the learning of multi-layer NNs (including quite practical issues such as teacher-student scenario). The Nobel Prize awarded last year to J. J. Hopfield was a controversial topic among physicists. But one lesser-known fact is that when G. Parisi won the prize in 2021, the citation already referred to AI theory—specifically in relation to his theories on glassy disordered systems and its relevance to DL.


Of course, as one of the TMI group members pointed out, to make these more practically applicable, they must be further refined by scholars in statistical learning theory, and should be integrated with the fields of computational theory and optimization. For example, one may see 'dynamical mean-field theory' approaches by T. Suzuki group (U Tokyo) and how they rigorously explain feature learning and in-context learning.


Next month, I will host a focus review session introducing high-dimensional random geometry (which also employs SP methods for disordered systems) in the context of modern deep learning. It begins with a simple and general geometric problem—separating labeled points (or ellipsoids) with a hyperplane—but ultimately explains the surprising success of modern AI, including few-shot learning and in-context learning.


For the former, see B. Sorscher, S. Ganguli and H Sompolinsky, "Neural representation geometry underlies few-shot concept learning," Prog. Natl. Acad. Sci. 119 (2022). For the latter, see A. J. Wakhloo, T. J. Sussman and SueYeon Chung, "Linear classification of neural manifolds with correlated variability," Phys. Rev. Lett. 131 (2023) and A. Kirsanov, C. N. Chou, Kyunghyun Cho and SueYeon Chung, "The geometry of prompting: Unveiling distinct mechanisms of task adaptation in language models," arXiv:2502.08009 (2025).


On a lighter note, in a KIAS lecture series planned to held at early August this year, Prof. SueYeon Chung is invited as a lecturer. I am looking forward the lecture since it is first time for me to attend Prof. Chung's lecture in-person.


See this post at LinkedIn: link
See this post at Facebook (Korean): link

Presentation Material

 

(국문)
몇 달 전 TMI group이라는 다학제적 모임에 조인하게 되었습니다. AI, 신경과학, 물리학, 교육학, 철학 등 여러 지적 배경의 대학원생들이 참여하는데요, 모임장님이 잘 리드하시는 덕분에 모임의 응집력도 꾸준히 유지되고, 다학제적 모임임에도 느슨한 교류를 넘어 상당히 구체적인 이론적 쟁점에 대한 논의들도 오가는 편이라서 많이 배워 가고 있습니다. 분석철학에서의 중국어 방 문제, 기존 언어학에서의 형식주의적 접근과 LLM의 통계적 해법의 화해 가능성, 신경과학의 자유에너지 원리 등에 대해 논문들을 바탕으로 개괄하고 토의하고 있습니다.

지난주 제 발표 순서에서는 '딥러닝에 대한 통계물리적 접근: 동역학적 및 구조적 관점(DL x SP)'라는 제목으로 세미나를 진행했습니다. 딥러닝이란 비선형성을 갖고 확률적인 동역학을 바탕으로 고차원 표현들을 형성하는 다체계이며, 따라서 통계역학의 적법한 주제가 되어왔음을 전달하고자 했습니다.

현대 딥러닝은 굉장히 많은 노하우들이 접목되어 탄생하였고 그만큼 다양한 관점에서 그 원리가 분석될 수 있습니다. 심지어 통계물리학 안에서도 딥러닝을 보는 여러 가지 관점들이 있고, 그들은 서로 다른 층위에 있으므로 단일한 픽쳐로 잘 합쳐지기가 어렵습니다. 그들 중 일부는 물론 쓸모있지만 비교적 현상론적인 반면, 다른 일부는 심층신경망의 구조적 특징을 꽤 근본적으로 건드립니다. 최근에 저는 'disorder'(마치 glassy system 즉 유리와 같은)가 딥러닝에 대한 통계물리적 관점에서 가장 중심적인 개념이라고 생각하고 있습니다.

수많은 서로 다른 가중치들이 비선형적으로 연결된 심층신경망은 지극히 복잡하지만, 그것이 무언가를 학습해서 좋은 표현을 형성하는 한 완전한 무작위 장과는 구분될 수도 있습니다. 복잡하지만, 분명히 어떤 식으로든 구조화되어 있고 (특히 차원이 너무나 높은 덕분에) 생각보다 상황이 좋을 수도 있다는 것입니다.

Replica method를 비롯한 무질서계에 대한 통계역학 이론들을 이러한 미묘하고 중간적인 영역에 적합하게 적용하여, 딥러닝 커뮤니티에서 실질적으로 중요한 여러 개념들, 예컨대 lazy (kernel) learning vs feature learning, flat minima, linear mode connectivity 등과 우아하게 연관지을 수 있습니다 (예시: B. L. Annesi et al., "Star-shaped space of solutions of the spherical negative perceptron," Physical Review Letters 131 (2023)).

사실 이러한 무질서계 관점은 딥러닝 초창기에 그 기원을 찾을 수 있습니다. 8-90년대에 물리학자들은 이미 다층 신경망의 패턴학습과 상전이를 분석하는 연구를 다수 진행했고 이는 때때로 현대 기준으로 보아도 상당히 프랙티컬한 주제(이를테면 전이학습에서의 teacher-student 시나리오)에 대한 관심으로 이어졌습니다.

작년 J. J. Hopfield의 노벨물리학상 수상은 세간에 화제였을뿐 아니라 물리학자들 사이에서 꽤나 논란이었는데요, 사람들이 잘 모르는 사실은 G. Parisi가 2021년에 물리학상을 수상했을 때에도 시상 취지 중 하나에 이미 머신러닝에의 이론적 기여가 명시적으로 포함되어 있었다는 점입니다. 이는 Parisi가 무질서계 해석을 위해 제안한 replica 방법이, 유리를 닮은 계 중에서도 특히 딥러닝을 설명하기에 유용했기 때문입니다.

물론, TMI group의 멤버께서 올바르게 지적했듯이, 이러한 통계역학적 관점이 흥미로운 설명을 넘어 실질적인 쟁점과 새로운 지식을 제공하기 위해서는 statistical learning theory 등을 비롯한 보다 수학에 가까운 분야의 이론가들의 참여를 통해 더욱 rigor를 갖추고, 계산이론 및 최적화 등과 관련지어질 필요도 있겠습니다. 최근에 dynamical mean field theory 쪽이 이러한 방향으로 상당한 진전을 보면서 feature learning, in-context learning 등의 설명에 이르고 있는데 (대표적으로 도쿄대학 Taiji Suzuki 그룹), 여기에 disorder 및 고차원과 같은 딥러닝의 특징이 얼마나 반영될 수 있는지 (혹은 그럴 필요가 없는지)는 저도 더 공부해보아야 할 것 같습니다.

다음달의 focus review에서는, 개괄적이었던 이번 세미나에서 꾸준히 시사되었으나 구체적으로 다뤄지지는 않은 '고차원'의 이점을 소개할 계획입니다. 위에도 썼듯 딥러닝의 성공은 무질서와 고차원 사이의 미묘함에 있다고 보기 때문입니다. 고차원 무작위 기하학을 바탕으로 딥러닝의 성능 척도를 성공적으로 예측하는 통계역학적 이론들을 다루고자 합니다.

이들은 매우 간단하고 일반적인 기하 문제 (색깔이 칠해진 채로 랜덤하게 흩뿌려진 점들 혹은 타원체들을 단 하나의 평면으로 올바르게 분리할 수 있는지 여부, 혹은 그럴 확률)에서 출발하여, few-shot learning, 그리고 prompt를 통한 in-context learning 등 현대 AI의 놀라운 현상들까지 기하적으로 잘 설명해냅니다.

전자에 대한 것은 B. Sorscher, S. Ganguli and H Sompolinsky, "Neural representation geometry underlies few-shot concept learning," Prog. Natl. Acad. Sci. 119 (2022), 후자에 대한 것은 A. J. Wakhloo, T. J. Sussman and SueYeon Chung, "Linear classification of neural manifolds with correlated variability," Phys. Rev. Lett. 131 (2023)A. Kirsanov, C. N. Chou, Kyunghyun Cho and SueYeon Chung, "The geometry of prompting: Unveiling distinct mechanisms of task adaptation in language models," arXiv:2502.08009 (2025) 등이 그 예시가 되겠습니다.

여담이지만 8월 초에 저도 참석하기로 한 고등과학원 lecture series에 정수연 교수님께서 강연자로 오시게 되었는데, 직접 말씀 들어 보는 것은 처음이라 매우 기대가 됩니다.

- 끝 -

Thursday, June 26, 2025

Review of "Thermodynamics of quantum information flows"

On June 26, I gave a talk at the 13th Workshop on Nonequilibrium Fluctuation Theorems, reviewing a paper (K. Ptazyński and M. Esposito, "Thermodynamics of quantum information flows," Physical Review Letters 2019, link) on quantum thermodynamics. I am grateful for Prof. Jong-Min Park of APCTP for giving me a good chance.

The paper itself have a clear, insightful message but quite concisely written, so I supplemented my talk with additional background and future directions. I began by introducing the concept of information flow, showing how this notion is elegantly connected to the second law of thermodynamics for subsystems.


This concept of information flow has been a central theme in my recent ongoing research. It underlies many apparently second-law-violating phenomena —flows emerging in the absence of gradients or even against gradients. Here, information flow can be understood as a thermodynamic resource like free energy.

Next, I outlined the density matrix formalism of QM, along with some basic concepts such as pure/mixed states and entangled/separable states. I especially enjoyed calculations using the operator properties and working with the Bell state examples by my hand. Although I had studied a little bit of textbook QM before, unfamiliarity on those formalism had often felt like barriers when reading papers in this area. What I have learned while preparing this part will likely make future readings much easier.

Next, I discussed about Lindblad equation which is a Markovian, CPTP framework of describing open quantum systems. Deriving Spohn's theorem (which is a key step for the emergence of thermodynamic irreversibility) from the 'contractive' property of Lindbladian dynamics was very impressive.

While the main body of the paper is not very extensive, it draws a close analogy with classical systems by defining an information flow between two subsystems in the Lindblad setting and successfully connects it with the (modified) second law for subsystems. Authors then exemplify their theory with a two-quantum-dot system.


What directions might future work take? In analogy with my ongoing work on classical regime, one could formulate a trajectory-level (before averaged) version of information flow in the quantum setting and conduct large deviation analysis to systematically unravel the trajectory-wise structure of apparent second-law violation.

Meanwhile, quantum entanglement is a very different type of resource from thermodynamic resources. For example, dissipation, which is typically seen as detrimental in thermodynamic terms, can actually enhance entanglement (called dissipative preparation). Since quantum mutual information approximates or bounds the entanglement, it may be possible—at least in restricted scenarios—to relate thermodynamic resources like information flow to entanglement.

Additionally, there has been works that leverage dissipation for quantum error correction, or overcoming barren plateau in quantum ML tasks like VQE. These kind of works may also be fruitfully connected to the framework of quantum (stochastic) thermodynamics.

See this post on LinkedIn: link
See this post on Facebook (Korean): link

Presentation material






(국문)
지난 6월 25-27일에 양평에서 진행된 13th Workshop on Nonequilibrium Fluctuation Theorem에서 톡을 할 기회를 얻어서, 제 최근 관심사이자 연구주제인 정보열역학의 continuous dynamical system 포말리즘을 양자역학에 확장한 논문(K. Ptazyński and M. Esposito, "Thermodynamics of quantum information flows," Physical Review Letters 2019, 링크)을 리뷰하는 시간을 가졌습니다.

논문은 명료한 main result를 가지고 있지만 핵심 내용만으로 발표를 구성하기엔 길이가 다소 짧아서, 발표 준비 과정에서 어차피 공부해야 했던 기초적인 내용들을 발표에 삽입하여 청중과 함께 살펴보고자 했습니다. 사실 이번 발표는 제가 잘 준비했다고 생각한 맨 앞부분에서 여러 질문에 답을 잘 못하는 바람에, 성공적이었다고 보기는 어려웠습니다. 그래도 많이 질문해 주신 덕분에 사후적으로 내용도 더 정리해 보고 많이 배우는 시간이 되었던 것 같습니다.

먼저 정보이론의 맥락에서 정의된 정보 흐름 (information flow)이 엔트로피와, 나아가서 열역학과 연결되는 과정을 소개했습니다. 정보흐름은 제 최근 연구 주제에서 핵심적인 역할을 하는 물리량인데요, 기울기가 없음에도, 혹은 아예 기울기를 역행하여 어떤 '흐름'이 발생하는 등 겉보기에 열역학 2법칙을 위반하는 여러 현상들의 열역학적 한계를 이야기해 줍니다. 정보 흐름 또한 마치 자유에너지처럼 우리가 유용한 일을 하기 위한 열역학적 자원인 것입니다.

다음으로 양자역학의 밀도행렬 포말리즘과, pure/mixed state, 양자 얽힘의 개념 등을 다루었습니다. 연산자의 성질을 바탕으로 여러 공식을 간단하게 만드는 과정과, Bell state를 가지고 pure/mixed, entanglement 등의 개념을 연습삼아 계산해보는 과정이 특히 재미있었습니다. 양자역학을 교과서로 공부하긴 했음에도 이런 개념들에 익숙하지는 않은 것이 양자쪽 논문 훑어볼 때 늘 장벽이 되었었는데, 이번 발표 준비를 계기로 조금 더 익숙해질 수 있었던 것 같습니다.

다음으로는 외부와 접촉하고 있는 열린 양자계(open quantum system)를 다루는 하나의 방법인 Lindblad equation을 소개하였습니다. Lindblad operator가 만족하는 contractive 성질(계속 가할수록 quantum relative entropy가 줄어든다)로부터 Spohn's inequality를 통해 열역학적 비가역성이 도출되는 것이 매우 인상적이었습니다. 앞으로는 Lindblad equation뿐 아니라 열린양자계를 기술하는 다른 여러가지 근사적 방정식들이 어떤 서로 다른 가정 하에 어떻게 얻어지는지도 공부해보면 좋을 것 같습니다.

논문의 메인 내용은 이렇게 기술되는 열린 양자계에서 고전역학에서의 개념을 거의 parallel하게 따라서 두 subsystem 사이의 정보 흐름을 정의하고, 이것이 subsystem에서의 2법칙 위배를 어떻게 설명하는지 보여주는 것입니다. 두 개의 양자점을 연결시키고 한쪽에 drive를 세게 걸어서 다른 쪽에서 기울기에 역행하는 흐름이 생기게 한 시스템을 예시로 보여줍니다.

후속연구로는 무엇이 가능할까요? 먼저 제가 현재 고전역학 영역에서 진행중인 연구와 패러렐하게, 양자에서도 '평균되기 전'의 정보 흐름(stochastic info flow라고 부르고 있습니다)을 정의하고 이에 대한 large deviation 분석을 수행하여 subsystem이 열역학 제2법칙을 위배하는 구조를 체계적으로 unravel해 볼 수 있습니다.

한편, 양자 얽힘과의 관계도 생각해볼 수 있습니다. 양자 얽힘은 자유에너지 등 흔히 생각하는 열역학적인 자원과는 굉장히 다른 종류의 resource라서, 열역학적 원리와의 연결이 그리 명백하거나 단순하지 않습니다. 예컨대 통념과 달리 외부와의 열적 접촉에 의해 오히려 얽힘이 늘어나는 일이 가능합니다 (dissipative preparation). 이러한 상황에서 quantum mutual information을 공통된 고리 삼아서, 제한된 상황에서나마 양자 얽힘에 대한 resouce theory와 양자 정보열역학을 연결지을 수 있을 것 같습니다 (이를테면 얽힘 형성의 speed limit 등).

이외에 꼭 정보흐름이랑 상관은 없더라도 양자역학 분야, 특히 추상화된 양자 알고리즘보다는 조금 더 통계물리학 백그라운드를 가진 학도로서 기여할 수 있는 부분들에 대해 개인적으로 요새 점점 관심이 커지고 있습니다. 예컨대 열적 접촉에 의한 노이즈를 활용하여 양자 오류정정(quantum error correction)을 하거나, VQE를 비롯한 양자 ML에서 barren plateau (대충 말하자면, 최적화 과정에서 빠져나가기 어려운 드넓은 영역)를 극복하는 등의 연구가 있습니다. 특히 후자는 고전적 딥 러닝에서 SGD를 통해 안 좋은 영역에서 빠져나오는 것과 약간 겹쳐 보여서 흥미롭게 느껴지기도 합니다. 또한 open quantum system과는 얼마나 관련될지 모르겠지만, quantum sensing에서는 quantum fisher information (파라미터가 변할 때 분포 변화의 민감성)이 상전이점 근처에서 발산하므로, 그 근처에서 초정밀한 측정이 가능하다는 내용이 있다고 합니다. 이 또한 통계물리학도로서 흥미롭게 느껴집니다.

아무리 타과 출신이라도, 물리학도로서 양자를 너무 모르는 것이 그동안 콤플렉스였는데, 밀도행렬 포말리즘을 기초부터 공부해 봄과 동시에 제 최근 관심사인 정보열역학과도 연결짓는 좋은 논문을 읽어 보고, 양자 쪽에 있는 고유한 이슈들을 이해해 볼 수 있어서 저로서도 유익한 시간이었습니다.

Thursday, May 8, 2025

2025-04-23 한국물리학회 봄학술대회 (대전) 참석 후기

수요일에서 금요일까지 진행된 한국물리학회 봄학술대회에 참여하고 일요일까지 대전에 조금 더 머물렀다.

학회에서는 맥스웰의 악마, 정보열역학 등에 대한 내 최근의 연구 주제를 바탕으로 포스터 발표를 했다. 사실 기본 틀 자체는 지난 학기에 한 것과 똑같은데, 이번에 큰 편차 이론(large deviation theory)을 바탕으로 진전된 내용들을 추가해서 가지고 갔다. 애정을 가진 주제인데 이번에도 교수님들께는 많이 못 보여드린 것이 아쉽긴 하지만 다행히 함께 공부하는 입장인 대학원생 동료들이 많이 와서 재밌게 들어주셨고, 통계물리가 아닌 다른 분야에 있는 분들에게도 어느정도 재미있게 설명이 가능한 주제인 것 같다는 생각을 했다.



통계물리 분야는 본래 이런저런 워크숍도 많고 서로 꽤나 돈독한 편인데, 이번 물리학회에 와보니 슬슬 모르는 얼굴들이 많아진다는 생각을 했다. 주로 대학원에 새로 들어오신 분들일 텐데, 그 분들과도 새롭게 통성명하고 인사를 나누고 싶지만, 달리 말하면 이는 어느새 졸업을 생각할 시기가 다가오고 있다는 뜻도 된다. 그동안 교수님과 동료 학생들의 도움을 참 많이 받았는데 앞으로는 떳떳한 박사가 될 수 있게 남은 기간 동안 내 스스로의 힘으로 포말리즘을 써 내려가고 계산을 뚫으면서 연구를 할 수 있다는 증명을 하면 좋을 것 같다.

학회 끝나고서는 일단 자전거를 꽤 많이 탔다. 대전이 자전거 타기에 참 좋은 도시다. 택시비를 쓰지 말아 보자는 생각으로, 어디 갈때면 공용자전거 타슈를 타고 지하철 역까지 가서 도시철도를 이용하는 식으로 이동했다. 특히 갑천을 따라 DCC부터 어은동에 이르는 길이 평탄하고 사람도 많지 않은지라 자전거를 타기에 정말 좋아서, 친구를 기다리며 편도로 세 번 정도 달려 보기도 했다.




주말 약속은 모두 고등학교 친구들이었다. 고교 동기들은 단 2년만 함께했는데도 불구하고 오랜만에 봐도 참 한결같다고 느껴질 때가 많아서 신기하다. 그래도 각자 가는 길은 다르다. 고등학교 때는 당연히 대부분 대학원 가서 박사 하고 그럴 줄 알았는데, 생각보다 대학원에 남아있는 사람이 많지는 않고 (특히 나랑 친했던 애들이 더 그런 것 같다) 다들 각자의 위치에서 잘 살고 있구나 생각했다. 이제 나만 잘하면 된다...ㅠㅠ

특히 이번에 카이스트 교수가 된 동기도 만나서, 연구실 구경할 겸 카이스트 산책도 했다. 우리 한성과학고 21기 중에 교수 임용은 처음인 걸로 아는데, 이 친구는 최근 수 년간 파격적으로 젊은 학자 채용을 많이 한 AI나 AI반도체 쪽이 아닌데도 불구하고 아주 젊은 나이에 임용된 거라 더 대단하다고 느낀다. 고교 시절이나 학부 때도 뽐내는 타입이 아닌데도 늘 잘하고 집념도 대단하고 태도도 남다르다고 생각했는데 잘되어서 보기에 참 좋았다.

그리고 대전역에 꿈돌이 매장이 있다고 하길래 마음의 준비 없이 들렀다가 홀린 듯이 많이 사 버렸다. 표정을 알 수 없고 무언가를 꿈꾸는 듯한 근본-꿈돌이는 지극히 담백하고 귀엽지만 다소간에 고전적인 '도안'의 개념에 묶여 있는 느낌도 있는데, 요새 재조명되면서 나오는 꿈돌이들은 표정도 풍부한 편이고 통통하며 친근감이 있다. 처음 볼 때는 상당히 낯설었는데 계속 보다 보니 또 괜찮은 듯하다. 한 도시의 (사실상)마스코트가 미래 과학기술 관련이고, 최고층 건물 이름도 사이언스센터인 것은 참 멋진 일인 듯하다.



주말에 묵은 숙소 바로 앞에는 옛날식 찻집이 있었는데, 어항도 여러 개 있고 식물도 많이 있어서 약간 2000년대 한국 영화 미장센 느낌이 났다. 주인분이 내 지갑에 있는 실밥들을 보시더니 오래 써야 된다며 라이터로 실밥을 태워주셔서 약간 무섭기도 했지만 호의도 느낄 수 있었다.

내가 식사빵 말고 간식빵은 별로 좋아하지 않아서 대전 올 때도 성심당을 잘 안 갔었는데, 이번에 아침에 줄이 별로 없길래 거의 처음으로 제대로 둘러봤다. 고구마 빵이랑 거북메론빵을 샀는데 가격도 저렴할뿐더러 아주 예쁘고 맛있었다. 내년 봄 KPS는 평소와 달리 대전에서 안 하는지라, 이번에 대전 한번 열심히 둘러보길 잘한 것 같다.

Facebook에서 이 글 보기: 링크

Thursday, November 21, 2024

복잡계 분야 윤혜진 교수님의 서울대 경영대 부임 소식

우리 교수님의 교수님이신 정하웅 교수님의 또다른 박사 제자이신 윤혜진 교수님(켈로그 스쿨)께서 이번에 서울대학교 경영대학으로 옮겨 오셨다는 소식(링크)이다. 부임한 지 얼마 안 되셔서 바쁘시겠지만 우리 연구실에도 초청 강연을 추진해 보면 좋겠다.

복잡계물리 쪽 연구방법론으로 인문사회 쪽 전공에 임용되신 또다른 경우로는 서울대 사회학과 손윤규 교수님이 계시며, 융합적인 전공에서 데이터 기반으로 인문사회학적 문제를 연구하시는 분들로 넓혀 보면 경희대학교 육순형 교수님, 숭실대학교 윤진혁 교수님 등 더욱 많이 계신다.


Facebook에서 이 글 보기: 링크

Tuesday, October 8, 2024

2024년 노벨물리학상 및 노벨화학상에 대한 단상들

2024.10.08.

올해 노벨물리학상은 굉장한 화제와 논란을 낳고 있는데 개인적으로는 매우 환영하는 바이며 전혀 이상하지 않게 느껴진다. 수상자 중에 제프리 힌튼(Geoffrey Hinton)이야 딥러닝 분야의 최고 기여자로 늘 세 손가락 안에 꼽힐 정도로 유명하고, 또다른 수상자인 존 홉필드(J. J. Hopfield)가 어떤 분인지에 대해서는 마침 작년에 썼던 글이 있어서 공유해본다 (게시물: 링크).

나야 무척 환영이지만 논쟁적인 수상이긴 할 것 같기는 한데, 심지어 물리학을 공부하는 대학원생들 중에서도 순수물리학이 아닌 인공지능 분야가 노벨물리학상을 받았다며 비꼬거나 부정적으로 보는 분들이 많이 있는 걸 보면 분위기가 별로 좋지만은 않은 듯하다.

먼저 사람들이 크게 오해하고 있는 부분은, AI가 성공하고 나니까 물리학이 뒤늦게 숟가락을 얹어서 시상을 했다는 생각이다. 힌튼은 또 몰라도, 홉필드의 경우 신경망 연구를 하긴 했지만 그 때나 지금이나 완전히 물리학자였고, 그 신경망 연구도 명백한 물리학의 한 분야로 인식되고 연구된 것이니, 충분히 물리학상에 worth하다고 생각하긴 한다.

게다가 홉필드만 일탈적으로 그런 연구를 한게 아니라 한국을 포함한 수많은 나라의 물리학자들이 당시에 신경망 학습 연구를 했다. 과거에 트랜지스터도 물리학자들이 발명한 뒤에 공학자들에 의해 미세화되면서 전기전자공학을 뒤집어 놓은 건데, 첫 발명자인 물리학자들이 노벨 물리학상을 받은것에 사람들이 큰 이의는 없듯이... 인공지능도 전혀 다르지 않은데 사람들이 잘 몰라주는 듯해서 아쉽다.


수차례 언급했듯이 딥러닝의 기초 원리(뿐만 아니라 self-supervised learning, transfer learning 등을 비롯한 상당수의 현대적 학습기법까지)는 인공신경망에 있어서 비선형 신경 동역학 관점의 간접화, 역전파법의 적용, 연산방법 혁신 및 하드웨어 연산량의 증대 등을 거쳐서, 딥러닝이 현실화되기 한참 전인 90년대경에 상당부분 수립되어 있었다. 그리고 그것을 주도한 것은 주로 패턴 기억과 재현에 관심을 가진 통계물리학자, 신경생물학자, 컴퓨터과학자들이기도 했다. 2012년 ImageNet을 계기로 딥러닝이 실현가능한 영역에 들어온 이후의 주요 발명 중에, 내가 아는 한에서 정말로 많이 새롭다고 할수 있는건 어텐션과 트랜스포머 정도일 것 같다.


홉필드는 작년에 우리 통계물리 분야 최고 상인 볼츠만 메달도 받은 바 있는데, 그게 이번 수상의 빌드업이었나 싶기도 하다. 아카데미 상을 받는 영화들이 그전까지 다른 시상식들에서 상을 쓸어담는 레이스를 하면서 분위기를 뜨겁게 달구는 것처럼, 과학계도 각 분야 최고 상을 휩쓰는 흐름이 노벨상 수상에 지표가 되는 그런 게 좀 있는 듯하다. 찾아보니, 또다른 통계물리분야 노벨상 수상자인 Kenneth Wilson과 Giorgio Parisi도 노벨상 받기 이전에 볼츠만 메달을 받은 바 있다.

Facebook에서 이 글 보기: 링크




2024.10.09.

알파폴드(AlphaFold)를 개발한 딥마인드의 데미스 허사비스가 언젠가는 노벨화학상을 받을 거라는 관측은 많았지만, 이렇게 빠르게 시상한 것은 예측을 뛰어넘는다는 평이다. 게다가 딥마인드 외에도, 원래부터 오랫동안 단백질 디자인 및 단백질구조 예측을 해온 대가인 David Baker도 수상을 했다.
(여담이지만 데미스 허사비스의 재미있는 경력에 대해서 이전에 포스팅한 바 있다. hapseda 블로그 링크, 본 블로그 링크)

물론 Baker는 단백질 연구에 대한 장기간의 큰 기여에 따라 종합적으로 받았다고 보아야 하기는 하며, 노벨상 공식 시상 취지에서는 단백질 디자인 쪽이 더 강조되어 있다. 그러나 알파폴드처럼 AI를 써서 단백질 구조 예측의 대혁신에 주요하게 기여한 연구로서, 2021년 게재 이후 순식간에 Baker의 현시점 최다 인용 논문이 되어버린 로제타폴드(RoseTTAfold)는 다름이 아니라 서울대학교 백민경 교수님이 Baker 그룹에 포닥으로 계실 때 1저자로 직접 개발하신 것이다.

로제타폴드 논문은 당시 알파폴드2랑 같은 날에 출판되어 큰 화제가 되었다. 나는 운좋게도 로제타폴드가 세상에 본격적으로 공개되기도 전에 백민경 교수님의 세미나를 들어 볼 기회가 있었는데 (관련 글 링크 - 클래리티와 로제타폴드: 한국출신 유명과학자들의 강연을 들었던 귀중한 경험들), 비록 백 교수님께 노벨상이 직접 주어지지는 않았지만, 그래핀과 위상부도체라는 2개의 분야에서 빼놓을 수 없는 업적을 세우신 김필립 교수님을 비롯한 몇몇 분들과 더불어서, 노벨상 업적과의 학문적 거리가 가장 가까운 한국인 중 한 분이 되신 듯하다.

Facebook에서 이 글 보기: 링크




2024.10.09.

인공신경망의 패턴학습에 대한 물리학적 연구는 오히려 옛날에 상전이, 무질서계의 이론 등을 바탕으로 꽤 널리 이루어졌었고 (물론 물리학자들의 것만은 아니고 컴퓨터과학, 신경과학/인지과학 등과 함께) 그런 연구들이 축적되고 발전해서 지금처럼 된 것이라, 일각의 잘못된 이해처럼 홉필드 등의 연구의 사소한 연관성을 바탕으로 이제 와서 억지로 물리와 엮는다고 보기는 어렵다. 오히려 인공신경망 연구의 중심에서 통계물리학이 주도해 온 역사가 있으며 당대에 인공신경망 연구는 명백한 물리학의 한 연구 주제로 취급되었다.

관련해서 이전에도 이미 Facebook에 업로드한 적 있지만, 그 시절에 한국어로 나왔던 논문 하나를 캡쳐해서 첨부한다 (김형균, 권철안, "서로 다른 구조를 가지는 신경망 사이의 학습," 새물리 39, 6 (1999)., 첫 페이지는 하단에 캡쳐). 현재 딥러닝과의 공통점 및 차이점들에 주목해 보면 어떤 느낌이었는지 알 수 있을 것이다.




이외에도 내 서재에는 이런 주제들로 된, 국내기관인 APCTP에서 발간한 당대의 국제 프로시딩집도 있는데, 이 프로시딩집이 왜 나한테 흘러들어왔는지는 잘 모르겠다.

이 시절에는 인공신경망을 제안하고 개선하는 것과, 그 작동원리를 분석하고 입증하는 것 사이의 거리가 지금보다 가까웠던 것으로 보인다. 그런데 지금은 인공신경망을 실제로 발전시키는 연구와 인공신경망의 성능의 비밀을 설명, 분석하는 연구 중 전자는 다들 알다시피 어마어마하게 성공하며 커졌고, 우리 통계물리학의 역할은 주로 후자 중에서도 일부분을 담당하고 있는 듯하다.

지금보다 더 모를 때에 나열 식으로만 썼던 글이긴 한데, 후자의 방향에서 물리학자들의 현재 이론적 관심사에 대해 22년도에 개인적으로 정리해 본 글이 있다 (머신러닝의 물리학: 개괄 및 문헌 소개).

조만간 쓸 기회가 있겠지만, 해당 글에는 없지만 보다 최근에 부상하는 또다른 관점 중에는 바로 고차원 잠재공간의 기하학에서 오는 뉴럴넷의 우수한 표현능력(expressibility)을 무질서계의 통계역학을 통해 분석하는 것도 있다. 이는 사전학습된 거대 모델을 활용하는 최근의 딥러닝 흐름에도 상당히 부합하는 이론적 연구방향으로 보인다.

물리학적 방법 외에 Neural Scaling Law 쪽을 비롯한 대규모 실험연구나, 수학적 증명을 통해 성능을 설명하는 연구, 프롬프팅을 통해 마치 인간 행동을 연구하듯이 LLM을 평가하는 연구 등 여러 방법으로 펀더멘털한 연구들이 많은데, 이들은 실제 딥러닝 업계와 보다 활발히 교류하는 듯하다.

Facebook에서 이 글 보기: 링크

Friday, August 9, 2024

지중해의 휴양지, 코르시카 꺄흐제즈(Cargèse) 여름 학교에 가다!

여기에 와서 유럽 학생들이랑 어울리겠다고 처음으로 WhatsApp이랑 PayPal을 다 깔아봤다.
지금 참석 중인 Summer School은 지중해의 코르시카 섬에 있는 Cargèse라는 마을에서 열리고 있다. 교과서적 프랑스어 발음으로 말하자면 꺄흐제즈 정도일 텐데 여기 사람들은 그냥 카르제스 정도로 부른다. 코르시카의 최대도시인 아작시오(Ajaccio)에서 셔틀버스를 타고 산악지대 풍경을 보면서 굽이굽이 길을 따라 1시간 정도 오면 도착한다.

여긴 통신이 잘 안 터질 때가 많고 에어컨이랑 찬 음료가 없어서 좀 지치긴 한다. 아이스 바닐라 라떼와 제로콜라가 그립다... 내가 있는곳은 숙소 겸 학회장소 (IESC, Institut d'Études Scientifiques de Cargèse) 인데, 주변엔 아무것도 없고 정말 이 시설뿐이다. 손전등 들고 30분 정도 산길을 걸으면 상점과 식당이 있는 중심가가 있어서 저녁은 거기서 먹는다. 거기도 말이 중심가지 인구가 1300명 정도 된다고 한다. 살면서 와 본 모든 곳 중 제일 외진 듯.

물론 멋진 점이 훨씬 많아서, 위와 같은 약간의 불편함들도 낭만으로 느껴진다. 밤이 되면 수많은 별들이랑 심지어 은하수까지 흐릿하게나마 보일 정도로 하늘이 깨끗하고 (12일 밤에는 페르세우스 유성우도 떨어진다고 해서 무척 기대 중이다), 이 일대에 말 그대로 우리밖에 없다 보니, 바닷가가 꽤 넓은데도 굉장히 프라이빗하고 깨끗하다. 엄청 오랜만에 사람들과 어울려서 해수욕 해 봤다. 그리고 빌리지가 멀다보니 아침 점심은 다 숙소에서 해결하는데 메인메뉴 작은 거 하나에 과일, 요거트, 빵 정도라서 뭔가 살 빠지고 건강해지는 느낌이 든다. 더워서 숙소 창문은 활짝 열고 자는데, 바닷가 + 산골인데도 곤충이나 뱀이 안 들어오는 것도 신기하다. 섬 자체에 뱀은 좀 있긴 하지만 독사는 없다고 한다. 밤길에 보면 도마뱀이랑 박쥐는 있다.

그렇다면 왜 스쿨을 이 곳에서 하는가? 이 스쿨은 나도 무척 관심 많은 곳인 룩셈부르크 대학의 통계물리, 생물물리 그룹들에서 주최하는 것인데, 코르시카가 약간 유럽인들에게는 제주도 포지션이라 그쪽 교수님들이 휴양 겸해서 하려고 여기로 잡은 것 같다. 그런데 찾아보니 그뿐만이 아니라 이 IESC라는 곳 자체가 1960년대에 출범해서 그때부터 이런 학회를 꾸준히 호스팅해온 근본있는 시설이라고 한다.

특히 이론물리학자 헤라르뒤스 엇호프트(Gerardus t'Hooft, 아직도 살아 계시고 작년인가에 한국이 주최하는 워크숍에서도 강연하심)가 이휘소 박사님의 강연을 듣고 영감을 받아 후일에 노벨상을 받게 되는 업적을 이룬 게 다름이 아니라 여기 카르제스 스쿨에서 일어난 일이라고 한다. 여기 시설에 뭔가 연혁이 써 있거나 흔적이 있거나 하지는 않던데, 그래도 그런 역사가 일어난 곳이라고 하니 반갑고 뜻깊다는 생각이 들었다.

아무튼 21일에 한국 돌아가자마자 삼척에서 invited talk 하는 게 있어서 맘 편히 있지는 못하고 그것도 틈틈이 준비 해야 되기는 하지만, 다시 오기 힘든 좋은 곳인만큼 스쿨 참여도, 휴양도 즐겁게 한 뒤에 귀국해야겠다.

Facebook에서 이 글 보기: 링크 (사진 포함)

Wednesday, March 20, 2024

거대모델이 건설되는 기술사회학적 과정, 그리고 90년대의 딥러닝 역사

삼전 DS부문 경계현 사장은 박사학위를 1994년에 뉴럴 네트워크를 결합한 로봇 제어기법으로 받았다. 이러한 이력을 보고 떠오른, 그러나 이 분 자체에 대한 인물평은 전혀 아닌 몇 가지 생각들을 써 본다.


삼성전자의 인공지능 칩 개발을 리드하는 경계현 사장.



경계현 사장의 1994년도 박사학위논문 서지사항.


AI 칩 관련 기술혁신 최전선의 돌파구를 탐색하는 데 있어서, 현재와는 많이 다른 모습이었을 뉴럴 네트워크 분야에 대한 이분의 학술연구 경험이, 주로 반도체 설계와 관련해서 삼성전자 내에서 쌓은 혁신적 리더십 경험에 견줄 만큼의 구체적인 도움이 되고 있을 가능성은 사실 높지 않을 것 같긴 하다. 그럼에도 불구하고, 90년대에 인공신경망 연구를 했다는 것은 개인사적으로 재미있게 느껴지는, 개인적 소회가 어떠실지 무척 궁금해지는 지점이기는 하다.

여담이지만 나는 학사졸업연구를 전기과 내의 제어 트랙에서 다개체시스템 제어 쪽으로 했는데 (트랙이란 것은 공식적인 것은 아니고 그냥 졸업연구를 제어 연구실에서 해 보았다는 정도이다), 이것이 경계현 사장님이 졸업한 제어계측공학과의 후신 격인 테크트리라는 점에서 또 한 번의 공연한 친밀감을 형성해 본다.


다음으로, 이 박사논문이 뉴럴네트워크 중에서도 하필 로봇제어에 대한 응용이다 보니 또 다른 생각들도 떠오른다. 그 얘기를 조금 해 보자.

딥러닝 중에서도 극히 최근의 패러다임(2020년 부근에 본격화된)은 초거대 모델을 수많은 데이터로 사전학습(pre-training)시킴으로써, 밑바닥부터의 재학습 내지는 전이학습 없이도 수많은 종류의 과제를 비교적 쉽게 수행하게 한다. 이는 전통적(?) 즉 2012년경부터 2010년대 후반쯤까지의 딥러닝과도 양적, 질적으로 꽤나 구분되는 새로운 패러다임으로 본다.

이러한 패러다임에서는 인류 전체가 산발적으로 생산하고 축적해온 데이터가 급격하게 일원적으로 수집되고 통합됨으로써 거대모델 구축에 활용되는 무척 흥미로운 기술사회학적 과정이 작용한다. 이러한 과정은 이미지(text-to-image generation), 텍스트(ChatGPT 등의 거대언어모델) 등 여러 도메인에 걸쳐 순차적으로 일어나 왔다.

그런데 최근에는 로봇 제어에 필요한, (좁은 의미의)기계적 상호작용과 관련된 운동학 및 제어공학, 비디오 등과 같은 도메인의 데이터 및 메타데이터들 역시 이러한 초거대모델 구축에 사용될 수 있게 수집되어 초거대화되는 과정이 급격히 나타나고 있는 듯하다. 이를 통해, 로봇들로 하여금 언어 프롬프트 기반으로 놀랄만큼 세련되고 복합적인 동작적 과업을 수행하게 하는 연구들도 속속 소개되고 있다. 물론 그러한 동작을 실제 가능하게 하는 하드웨어의 발전이 느리다는 문제도 있으나, 그러한 제약까지 고려해서 최대한 성공적인 제어를 가능하게 하는 기술들도 등장할 것 같다.

아마 생각보다 꽤 빠른 시일 내에 ChatGPT만큼, 혹은 그 이상으로 대중을 놀라게 할 돌파구가 로봇 쪽에서 다수 소개되지 않을까 한다. 그러한 기술들의 등장을 목전에 둔 지금의 시점에서, 위와 같이 90년대에 연구된 인공 신경망 기반의 로봇제어를 다시 찾아보고 사유해 보게 되면, 귀여운 아기토끼 같으면서도 먼 고대의 조상님처럼 느껴지는 것이 우리들에게 굉장히 독특한 기분을 선사할 듯하다.

90년대 당시와 지금의 신경망 연구를 조금 더 제너럴한 센스에서 비교해 보자면 상당히 양면적인 생각이 들 때가 있는데, 일단 먼저는 '엥 그때도 이런 용어들이 있었다고?' 싶을 만큼 주요 essense는 이미 그때 다 연구되어 있었구나 싶은 때가 있다. Teacher-student framework를 다루는 아래의 통계물리학 논문 캡쳐처럼 말이다.

Teacher-Student framework를 통계물리학의 관점에서 풀이한 1999년도 논문의 첫 장.


여담이지만, GPU를 뉴럴 넷 학습에 사용한 초창기 논문 중에서도 국내 학자들에 의해 연구된 것이 있다.

인공신경망 학습에 GPU를 사용하는 방법을 제안한 2004년도 논문의 첫 장.


그러나 한편으로는 딥러닝을 실제로 tractable하게 만드는 여러 노하우 및 신기술들의 도입과 계산 성능의 발전으로 인해, 지금과 그때의 인공신경망 연구는 양적으로나 질적으로나 단절에 가까운 완전히 상이한 모습으로 변화했기도 하다.

아무쪼록 딥러닝의 발전사를 추적할 때, AlexNet 및 알파고뿐만 아니라, 자연과학과 공학 양쪽에서 나름의 성과를 축적했었던 90년대까지의 역사도 더 많이 주목받고 탐구되기를 바란다.

Facebook에서 이 글 보기: 링크

Sunday, November 19, 2023

아시아태평양이론물리센터(APCTP) 본부 방문 소감

APCTP(아시아태평양이론물리센터)의 지원으로 하는 한국물리학회 통계물리분과 학술행사들은 여러 가지가 있지만, 이번 행사(140차 통계물리 월례회, 링크)는 다른 곳이 아니라 POSTECH 무은재기념관에 있는 APCTP HQ에서 열렸다. 포항공대는 두세번 와봤지만 APCTP에 직접 들어와 보는 것은 처음이었다.


전반적인 인상이 어땠냐면, 일단 적어도 HQ가 위치한 층은 시설을 상당히 잘 해 놓았으면서도, 여기가 바로 이론과학을 하는 곳이구나 하는 느낌이 확 든다 (고등과학원 갈때도 비슷하게 느낀다). 그리고 전시물이나 홍보물들도 워낙 잘 되어 있어서 이론물리를 상당히 대접해준다는 느낌이 들었다.

이게 포스텍 물리학과에서 그냥 만든 연구센터가 아니라, 실질적인 국제 기구로서 기능을 하게끔 국제 물리학계로부터 '유치'를 한 것이다 보니 더 여건이 좋은 점도 있는 듯하다.

약간 서울대 국제백신연구소랑 비슷하게, APCTP 유치 자체가 한국 과학계 국제협력사업의 쾌거였다고 알고 있다. 무려 Yang-Mills 이론의 양전닝이 초대 소장이었다고 한다.


아무튼 계속 지내면 어떨지 모르겠지만 방문객 입장에서는 인상이 굉장히 좋았고, APCTP HQ뿐만 아니라 포스텍의 다른 건물들도 신축의 경우 시설이 꽤 좋다. 특히 무은재기념관 바로 근처에 있는 건물은 내부가 무슨 국립미술관 내지는 코엑스처럼 생겨서 잘 되어 있고, 심지어 1층에는 테라로사가 입점해 있다. 포스텍 출신 지인들에게 물어보니, 우리 나이대가 졸업할 때쯤에 새로운 좋은 시설들이 많이 들어왔다고 한다.

이번 월례회는 개인 일정상 서울에 일찍 돌아와야 해서 이틀 일정 중 앞쪽 하루밖에 못 들었는데, 첫번째 톡은 내 분야와 굉장히 관련이 깊은, 미시적인 엔진들의 열역학에 대한 소개였다. 두번째 톡은 국형태 교수님의 은퇴기념 강연이었는데, 사실 나는 처음 알게 된 분이었지만, 최근에만 분과 행사에 잘 안 나오셨던 거고, 통계물리 및 동역학계(dynamical systems) 분야를 오랫동안 연구해 오신 분이었다.

동역학계를 연구해오신 교수님의 연구 여정에 관한 얘기도 재미있었지만 마지막에 과학문화 및 과학글쓰기 관련 말씀도 인상깊었다. 과학자들이 글을 투고할 수 있는 웹진인 APCTP의 <크로스로드>, 한국물리학회의 <물리학과 첨단기술> 의 편집위원 일을 오래 하셨고, 지금은 다름아니라 고등과학원 웹진 <Horizon>의 편집장이시라고 한다.


나도 과학 관련 글쓰기에 관심이 있는 입장에서, 그런 매체들은 어떻게 돌아가고 누가 담당해서 해 주시는 걸까 늘 궁금했었는데, 그리고 마침 전날에 대구에서 뵌 지인과도 과학글쓰기와 관련된 이야기를 나누었고 조언을 들었었는데, 의외의 곳에서 배경과 현황에 대해 들을 수 있어서 신기했다.

Facebook에서 이 글 보기: 링크

Sunday, November 12, 2023

깁스 역설: 개수를 세서 물리학을 하기, 그리고 측정의 형식에 알맞게 생각하기

고등학교 때 했던 생각이 있다. 사람들은 흔히 '사과의 개수를 세는 것'을 수학 교과서에 나오는, 수학의 전형적인 예제로 생각한다. 하지만 내 생각에 굳이 따지면 사과의 개수를 세는 것은, 자연수라는 형식체계를, 이산화하기 쉬워서 자연수로 잘 기술되는 사과라는 현실세계의 대상에 적용했다는 점에서 엄연히 가장 원초적인 '물리학'에 해당하는 것 같다.

물론 수학교육에서 현실 예시를 들어가면서 하는게 학습에 중요하다거나 하는 게 있을 테니... 사과의 개수 세기를 진짜로 과학교과서로 옮겨야 된다는 건 아니고, 그냥 내 머리속의 농담 같은 관념적 재분류일 뿐이다.


그런데 사실 내 전공분야인 통계물리학 또한 결국에는 개수를 세는 것이다. 시스템의 디테일에 크게 상관없이 개수만 잘 세어도 꽤 많은 물리적 성질들을 얻을 수 있다는 메시지가 있다.

물리학이라고 하면 뭔가 시공간 위에서 연속적인 것을 다루기 위해 미적분을 열심히 해야 할 것 같은데, 개수 세는 것만으로 물리를 할 수 있다니 이상하게 느껴질 수 있으나, 사실 그 spirit은 사과의 개수를 세는 원초적인 물리학에서부터 예고되고 있는 것이다. 물론 통계물리학에서는 대상의 개수를 세는 게 아니라 그 대상들의 배열이 이루는 state의 개수를 세는 것이므로 조금 더 추상적이기는 하다.


이게 공연히 오랜만에 다시 생각난 이유는, 요새 지인에게 Gibbs paradox를 공부해서 소소하게 가르칠 일이 있어서, 개수를 세는 것에 대해 계속 고민하다 보니까 그랬던 것이다.

Gibbs paradox는 입자들이 이루는 상태의 개수를 셀 때 입자 종류의 구분불가능성 (쉽게 말해 순열permutation을 조합combination으로 바꿔주는) 을 정당화하는 근거가 무엇인지에 대한 질문이다. 두 종류의 기체가 서로 분리되어 있다가 섞일 때 엔트로피가 증가하는지 여부와 관련된 paradox of mixing과도 궁극적으로 동일한 문제인데, 생각할수록 이상한 점들이 많아서 결코 간단한 문제가 아니고 굉장히 흥미롭다.

이에 대해 내가 통계역학을 여러 해에 걸쳐 접하면서 나름대로 고민해서 가지게 된 결론의 얼개가, Jaynes라는 물리학/통계학/정보이론 쪽에서 유명한 분의 견해와 거의 같다는 걸 이번에 알게 되어서 꽤나 뿌듯하기도 했다.


그 결론을 대략 요약하자면 다음과 같다. 입자들이 구분불가능한지 여부를 다르게 생각했을 (think different) 뿐인데 엔트로피라는 물리량이 바뀌는 (physics does change) 것은 굉장히 이상해 보인다. 예를 들어 까만색 입자와 흰색 입자를 우리가 구분해서 보겠다고 마음먹으면, 그 두 종류의 입자들이 섞일때 엔트로피는 증가한다. 근데 구분 안하고 통째로 보겠다고 마음먹으면, 서로 섞여도 엔트로피는 증가하지 않는다. 엄연히 객관성을 기해야 하는, 그리고 실험으로 측정이 가능한 physical quantity인데 주관에 따라 달라진다니? 이게 우리가 흔히 역설이라고 생각하는 부분일테다.

그러나 사실 우리가 구분불가능 여부를 전적으로 임의로 정할 수는 없는 것 같다. 우리가 시스템을 관찰하는 device의 해상도 내지는 형식에 따라서, 구분가능성의 여부는 어느정도 제한을 받는다. 그리고 그 세팅 하에서 physical quantity의 측정값을 설명하는 가장 유용한 effective theory가 무엇인지도 정해진다.

단, 이때 주어진 해상도 내지는 형식 하에서 입자의 종류에 대해 얼마든지 얻을수 있는 정보를 일부러 무시하면 안되고 최대한 다각도로 조사를 해야 하는 것 같다. 이렇게 하면 'think'와 'physics' 외에도 'probe' 라는 새로운 층위가 들어오게 되고, 여기서 'probe different' -> 'physics does change' 는 비교적 자연스러워 보인다.

그렇다면 think 부분은 어떻게 되는 건가? 내 생각에 'think'를 완전히 임의로 할 수가 없고 우리가 가진 'probe'의 형식에 알맞게 올바르게 think해야 하며, 그렇게 하면 우리의 이론은 우리가 가진 probe 상에서의 올바른 physics를 준다. 그리고 probe가 바뀌면 그에 맞게 physics가 바뀌는 것 같다.



예컨대 나는 만약에 원자 하나하나에 이름표를 붙이고 그것들의 운동을 일일이 쫓아갈수 있다면 열heat은 모두 일work이 되고, 우리가 흔히 보는 스케일에서 엔트로피라는 개념은 없어진다고 생각한다.

(그런데 10^23개 기체 입자에 서로 구별되는 이름을 붙이려면 최소한 원자 76개 길이의 binary sequence 꼬리가 필요하고... 그런데 충돌 전후에도 그 꼬리표가 안 파괴되고 안정적으로 유지되려면 꼬리표의 크기가 훨씬 커야 할 것이고... 이런 걸 생각하다 보면 왠지 저런 일이 근본적으로 forbidden되는 이유가 있을 듯. 아닐 수도 있고 말이다)

또한, 두 종류의 기체 입자가 서로 무게가 다르다거나 (심지어 고전적인 공(ball)들인데 색깔(!?)이 다르다거나) 해서 혼합 전후에 물리현상에 변화가 생길 가능성이 있으면, 가능한 모든 수단을 동원해서 실험해 보면 그 차이는 측정이 되는 것이므로, 그것을 일부러 무시하고 구분불가능하다고 하는 건 wrongly think different하는 것 같다. 이것은 다름아닌 mixing paradox로서, 바로 위 문단에 말한 예시보다 조금 더 미묘한 듯하다.


Gibbs paradox로 돌아오면, 자유 공간을 떠다니는 이상기체 분자들에서 엔트로피를 1/N! 으로 나눠 주는 게 양자역학적 입자들의 구분불가능성 (identical particles) 때문이라고 하는 게 아주 틀린 말은 아닐 수 있다. 그런데 일단 눈에 보일 정도의 기체 덩어리는 완전히 thermalize 되어 있고 전혀 coherent하지 않을 텐데 양자적 구분불가능성이 과연 relevant할지 살짝 의문이기도 하거니와 (이부분은 그냥 내가 양자를 잘 몰라서 그런 듯), 사실 꼭 coherent한 wavefunction으로 기술되는 양자역학적 입자가 아니더라도, 입자의 종류 차이가 우리가 가진 device에서의 measurable physics에 영향을 안 준다면 얼마든지 구분이 불가능할 수도 있는 것이고, 그럴 때에는 양자역학적 입자들과 마찬가지로 계산상으로도 구분을 안해주는 게 맞는 듯하다.

원자나 분자 같은 기본 입자들의 살짝 특별한 점은, 축구공이나 농구공처럼 자세히 들여다보면 서로 조금씩은 다른 일상 속 거시적 물체들과 달리 (애초에 그런 물체들이 따로따로 떠다니면서 10^23개씩 모여 있을 수 없기는 하지만) 정말로 fundamentally identical해서 probe의 해상도에 무관하게 구분이 불가능하다는 것.

물론 극히 최근에는 Gibbs paradox를 resolve하는 방법과 관련해서, 일본의 Shin-ichi Sasa 교수님의 연구팀에서 2021년에 Journal of Statistical Physics에 게재한 논문(Quasi-static Decomposition and the Gibbs Factorial in Small Thermodynamic Systems, 링크)을 비롯한 대안적인 논변들도 있다. 이 부분은 잊어버려서 한번 더 살펴봐야겠다. 아무튼 이런 게 아직도 연구 중인 open question이라는 점이 인상깊다.


이렇듯 개수를 어떻게 셀 것인가 하는 원초적인 문제가, 비가역성과 열역학 제2법칙의 근원이라는 통계역학의 가장 근본적이고 머리아픈 문제와도 연관이 되어 있다는 점은 대단히 흥미롭다.

여담이지만 나는 현재 주목받는 딥러닝이 대체 왜 이렇게 성공적인지에 대해서도, 디테일을 제하고서도 고차원 공간에서의 counting을 통해 약간은 감을 잡을 수 있다고 생각한다. 실제 근거가 되는 연구 리포트들도 있다. 통계물리학을 이용하여 딥러닝의 작동원리를 부분적으로 설명하는 성공적 시도들이 꽤 많은 것도, 바로 이런 공통점 때문이 아닐까 상상을 해 본다.

흔히 양자역학에서 관측 여부에 따라 물리가 달라지는 게 이상하다, 관측이라는 게 대체 무엇인가 하는 고민이 대중적으로 잘 알려져 있다. 그러나 내 생각에 이 Gibbs paradox 문제가 비가역성의 근원 문제와 연결되는 지점을 비롯한 여러가지 통계역학적 고민들이야말로, 양자역학의 관측 떡밥에 만만치 않게 미묘하고 재미있으면서, 우리의 거시적이고 일상적인 고민들 (microstate와 macrostate를 정의하는 문제 -> 로또번호 다른 것들은 잘만 나오면서 123456은 왜 안나올까 등등) 과도 훨씬 깊게 연관이 되는 것 같다.
Facebook에서 이 글 보기: 링크

Sunday, September 24, 2023

Review on "A statsitical mechanics framework for Bayesian deep neural networks beyond the infinite-width limit"

옆 연구실에서 주도하시고 우리도 참여하는 이론기계학습 공부 모임에서, 이번에 나는 폴란드 출장에서 돌아온 직후인 10월 초에 발표를 하게 되었다. 이번에 소개할 논문은 NNGP (neural network as Gaussian process), NTK (neural tangent kernel) 류의 접근이 finite width라는 보다 현실적인 상황에서 어떻게 수정되는지를 이론적으로 살펴본 논문이다 (S. Ariosto et al., arXiv:2209.04882).


방법론으로서 통계역학이라는 것은 결국 엄청 커다란 state space에서 확률분포함수를 끼고 적분하는 것을 N이 무한대로 가는 극한에서 편리하게 계산하는 여러 테크닉들이라고 볼 수 있다. 이 논문에서도 overparametrized NN을 이론적으로 분석할때 나오는 커다란 적분들을 통계역학적으로 처리한다.

아직 끝까지 읽지는 못했는데, 데이터셋의 크기 P가 input dimension N0보다 크고 그 ratio가 상수로 유지되되 (overparametrized), 각각이 무한대로 가는 나름대로 현실적인 regime을 다룬다. 이는 NTK regime에 비해 발전된 것이다. 여기서 통계역학을 적용해서 적분을 잘 계산한 다음에, Breuer-Major theorem이라고 하는 비선형 함수들의 합에 대한 일종의 일반화된 중심극한정리를 통해 몇 가지 흥미로운 결론을 얻는다.

특히 hidden layer가 1개인 뉴럴넷에 대해서는 분배함수가 exact form으로 계산되어 풍부한 이론적 분석을 해 볼 수가 있으며, 또한 finite-width에서는 NN이 Gaussian process 대신 student-t process에 해당한다는 꽤 그럴듯한 논의를 한다.

사실 이 논문을 요새 스터디를 함께하는 옆 연구실 선생님의 소개로 알고 나서, 도쿄에 학회 갔을 때 이 저자 중 한 명의 포스터발표를 직접 들었다. 네이쳐 계열 저널 중에도 머신러닝 관련 저널이 있는데 거기에 낼 예정이라고 했던 것 같다.

(+추가: 네이쳐 계열의 머신러닝 관련 저널인 Nature Machine Intelligence에 2023년 말에 출판되었다. 이에 따라 본 포스트의 제목도 출판된 해당 버전의 논문 제목으로 변경하였다.

Nature Machine Intelligence 저널에서 논문 보기: 링크)


Saturday, September 16, 2023

230915 NEST meeting 발표 후기 (Review on “Thermodynamic constraints on the power spectral density in and out of equilibrium”)

NEST meeting은 고등과학원 통계물리분과 교수님들 앞에서 학생들이 재밌게 읽은 논문을 ppt로 만들어서 소개하고 디스커션 하는 모임이다. Informal atmosphere의 모임이라고 하지만 ppt에 있는 계산 과정이 납득이 될 때까지 한줄 한줄 함께 봐주시기 때문에, 모임 준비의 주관적인 존재감은 꽤 큰 편이고 많은 공부가 된다.

이번에 내가 소개한 논문(링크: arXiv:2306.00417.)은 일본 교토대의 Andreas Dechant가 이번에 올린 아카이브 프리프린트인데, 확률적 물리계에서 Power Spectral Density (스펙트럼, 쉽게 말해 주파수별 신호의 세기) 의 모양이 열역학적 원리에 의해 제약이 된다는 꽤 멋있는 논문이다 (슬라이드 첨부, 하단에 내용 요약).


시스템의 PSD를 보는 것, 즉 무작위 시스템을 주파수 영역에서 분석하는 것은 시스템의 특성 이해에 매우 유용하므로 통신, 소자 및 여러 물리분야에서 표준적으로 쓰인다. 우리 비평형 통계물리 분야에서도 20세기 초중반에 확립된 linear response theory에서 이러한 접근이 많이 발달했다. 특히 fluctuation-dissipation relation은 계가 평형에 있을 경우, 계에 가해지는 요동의 PSD와, 계가 외란에 응답하는 방식이 주파수 영역에서 특정한 함수관계를 만족해야만 한다는 것을 알려주어 이론과 실험 양쪽에서 무척 유용하다.

그러나 참 이상하게도, 20세기 최후반에 등장하여 현재까지 활발히 연구되는 새로운 도구인 '확률열역학'(stochastic thermodynamics) 에서는 2005년의 Harada-Sasa relation 정도를 제외하고는 주파수 영역에서의 접근이 영 드물었다.

확률열역학에서는 주로 평형으로부터 미소하게 멀지 (linear response regime) 않고, 임의의 큰 정도만큼 멀리 떨어진 (far from equilibrium) 계를 다루며, 이때 비평형의 정도를 정량화하는 방법은 결국 비가역성의 척도인 '엔트로피 생성량'이다. 비평형에서만 가능한 여러 에너지 및 물질의 흐름들과 이례적 응답 방식들이 있는데, 이들이 선명하게 나타나려면 그에 상응하는 충분히 큰 엔트로피 생성량이 필요하다. 이를 명시적으로 밝힌 TUR, speed limit, EB 등의 부등식들이 지난 10년에 가까운 시간 동안 여럿 등장했다. 주파수 영역에서도, 이처럼 엔트로피 생성량에 의해 PSD의 모양이 제약되는 현상이 있다면 좋을 것이다.

이 논문에서는 PSD의 꽤 복잡한 표현식과 그것에 대한 더욱 복잡한 변분 표현 (variational expression)을 바탕으로, 임의의 확률적 계에서 PSD의 그래프가 가질 수 있는 상한선과 하한선을 제시한다.

과정의 세부는 매우 복잡하지만, 기본 아이디어를 기억하면 좋은 가이드라인이 된다: PSD의 푸리에 역변환인 autocorrelation function은 계가 시간에 따라 relax되는 (혹은 비평형의 경우 진동하는) 구조를 알려준다. 가만히 있는 것 같은 시스템도 시간에 따른 변화를 겪고 있으며, 그러한 동역학적 구조를 보기에 가장 좋은 방식은 바로 조건부확률이다.

이러한 조건부확률의 푸리에 변환을 바탕으로 PSD가 상당히 우아한 quadratic form 형태로 써지는데, 이에 대한 또다른 ㅡvariational한ㅡ 표현을 억지로 찾은 뒤에, 그 표현상에서 영리하게 '덜 optimize' 함으로써 PSD의 상한과 하한을 얻게 된다. 슬라이드에서 볼 수 있듯이 상한과 하한 모두 굉장히 스펙트럼스러운(?), 1/(a^2 + w^2) 형태를 가지므로, PSD의 asymptotics를 얘기하기에 아주 좋은 구조이다.

여기에 등장하는 상수들에도 물리적 의미를 부여해볼수 있는데, 1/lambda*의 경우, 주어진 시스템에 대응되는 평형 시스템에서의 가장 느린 relaxation time scale에 해당한다. 즉 주어진 시스템으로부터 만들어낼 수 있는 가장 느린, '가장 평형스러운(?)' 시간스케일이라고 할수 있다. 반대로 C_diss의 경우에는 엔트로피 생성의 총량과 직접 관련이 되어, 가장 '비평형스러운' 값이라고 할 수 있다. 이 두 가지 값이 절묘하게 조합되어 PSD의 asymptotics를 이루게 된다.


Facebook에서 이 글 보기: 링크

Friday, August 4, 2023

[논문 소개] Effects of the self-propulsion parity on the efficiency of fuel-consuming active heat engine

제 첫번째 1저자 논문(연료를 소모하는 능동열기관의 효율에서 자체추진력의 부호성질의 효과)이 Physical Review E에 출판되었습니다. (English description: below)



Bibliography: Yongjae Oh and Yongjoo Baek, "Effects of the self-propulsion parity on the efficiency of fuel-consuming active heat engine," Physical Review E 108, 024602 (2023).

Physical Review E link: https://lnkd.in/g6ASjWwp
arXiv preprint link: https://lnkd.in/gzyEKueJ

충돌에 의해 수동적으로 움직이는 일반적인 기체 대신에 에너지를 소모해 가며 스스로 헤엄치는 물질을 '능동 물질'이라고 합니다. 이러한 물질을 이용해서 엔진을 만들게 되면, 겉보기 효율이 전통적인 카르노 효율보다 높아질 수 있고 심지어 고온부와 저온부가 없이 하나의 온도로 된 환경 (예: 생물학적 계) 에서도 작동할 수 있습니다.

능동 열기관에서 정의되는 겉보기 효율은 전통적 효율로부터 자연스럽게 생각해낼 수 있으며, 또한 통계적 윤곽에 따른 유효 온도로부터 정의되므로 실험적 측정이 쉽습니다. 또한 전통적 한계를 넘는 상황을 잘 표현해주므로 중요합니다. 그러나 이러한 이례적으로 높은 효율이 정확히 어떠한 열역학적 원리에 의해 어디까지 가능한지는 이야기 해주지 못한다는 한계가 있습니다.

이는 입자가 헤엄치기 위해 필요한 숨겨진 에너지 흐름을 고려하지 않거나, 열(heat)과 일(work)을 올바르게 구분하지 않고 statistical profile을 바탕으로 유효적로만 다루어서 요동과 소산의 열역학적 구조를 적절히 밝혀주지 못하기 때문입니다.

이 논문에서는 먼저 연속적인 확률적 동역학에서 두 변수가 커플링되는 일반적인 이론적 구조를 제안합니다. 계가 열역학적 평형에 도달하려면 각 변수가 힘을 주고받는 구조에 대칭성(혹은 반대칭성)이 있어야 한다는 Onsager의 이론과 관련이 있습니다.

다음으로, 어떤 입자의 공간적 움직임에 연료 소모를 커플링시키고, 연료가 소진되지 않도록 chemical potential을 상수로 고정시킵니다. 이렇게 하면 그 입자는 상시적으로 평형으로부터 멀리 떨어진 능동물질이 됩니다.

그런데 이때 위에 말한 이론적 대응구조를 이용하면, 연료 소모량의 동역학이 확정되게 됩니다. 이렇게 써내려간 연료 소모의 동역학을 포함해서 열역학 제 1법칙을 쓰면 열을 정의할 수 있는데, 여기서 정의한 열이 확률적 개념으로부터 정의된 엔트로피와 정확히 일치한다는 것을 확인했습니다. 이렇게 엔트로피가 확률적인 개념으로부터 출발하는데도 단순히 비가역성의 statistical signature만 캡쳐하는 것이 아니라 정확한 에너지적 해석까지 갖는 모형을, 열역학에 부합하는 모형 (thermodynamically consistent model) 이라고 합니다.

이러한 엔트로피를 바탕으로 효율을 정의할 수 있는데, 이 효율 식의 분모에는 열과 연료 소모율(->일)이 둘 다, 그리고 서로 다른 비율로 들어가 있습니다. 이는 저희가 알기로 기존에 보고된 바 없는 식이지만, 사실 기존에 알려진 두 효율 식 (전통적 열기관 / 화학적 나노기계들) 의 자연스러운 interpolation 입니다.

이 양은 thermodynamically consistent하게 구성되었으므로 겉보기 효율과는 달리 명료한 에너지적 의미를 가지게끔 능동성의 근원을 밝히고 있으며, 또한 열역학 제 2법칙의 결과이기 때문에 늘 1보다 작다는 명확한 상한을 갖게 됩니다. 또한 이 효율을 가지고 위에 언급한 겉보기 효율도 recover할 수 있는데, 이 양이 카르노 효율을 넘을 수 있게끔 하는 에너지 흐름이 다름아니라 화학적 연료 소모임을 알 수 있습니다.

이 효율의 또다른 장점 중의 하나는 바로 시간 뒤집기에 따른 부호성질(parity)의 효과를 논할 수 있다는 것입니다. 능동입자의 추진력은 그 메커니즘에 따라 시간을 뒤집었을 때 그 부호가 바뀔수도 (odd parity), 유지될 수도 (even parity) 있습니다. 열역학에서 효율을 깎아먹는 요인은 바로 비가역성인데, 비가역성은 다름이 아니라 시간 뒤집기 변환 하에서의 비대칭성의 크기와 관련이 있으므로 이 둘의 효율 값은 달라야 합니다.

겉보기 효율로는 이 두 부호성질에서의 효율 차이가 캡쳐되지 않는데, 우리가 정의한 새로운 효율은 부호성질에 따라 달라지게 됩니다 (이 역시 thermodynamically consistent하게 해서 그렇습니다). 둘 중에 누가 더 효율적일지의 criterion은 unexpectedly 매우 간단하게 주어지는데, 엔진의 공간적 크기가 클수록 odd가, 작을수록 even이 더 효율이 높게 됩니다. 이러한 관찰은 직관적인 해석도 가능하며, 향후 마이크로미터 크기의, 잡음이 많은 환경에서 작동하는 기계를 디자인할때 좋은 참고가 될 수 있습니다.

Physical Review E는 미국물리학회에서 PRL, PRX 같은 최고 저널은 아니지만 준수한 논문들이 올라오는 각 부문별 저널 (PR A~E)의 하나로, 통계물리학 전공 연구자로 첫발을 뗀 느낌이라 이곳에 게재된 것을 기분좋게 생각합니다. 첫 연구를 정리하는 데 상당히 오래걸렸는데 그 과정에서 풀고 싶은 문제들이 많이 생긴 점은 다행이고, 앞으로의 학위과정 동안 이들 문제에 대해 의욕적으로 다루어보고자 합니다.

My first first-authored paper "Effects of the self-propulsion parity on the efficiency of a fuel-consuming active heat engine" is published in Physical Review E, an APS journal covering statistical, nonlinear, biological, and soft matter physics.


arXiv preprint link: https://lnkd.in/gzyEKueJ

This paper is motivated by the issue of describing the performance of 'active heat engine'. Active heat engine is an engine utilizing 'active particles' (or self-propelled particles) as its working substance instead of usual 'passive' gas particles. In this kind of engine, the efficiency can apparently be higher than the Carnot efficiency. This is important because it describes the engine operating at isothermal environment (such as biological systems), which is a behavior beyond the traditional limit.

However, this 'super-Carnot' behavior is possible because we neglect some hidden energy injection, or because we do not properly distinguish the concept of heat and work, just viewing the statistical signature of the dissipation as a whole. Therefore, this apparent efficiency lacks the relation with the fundamental laws of thermodynamics.

In this paper, we first develop a theoretical framework which guarantees a coupled continuous stochastic system reach thermodynamic equilibrium at the absence of external driving. Next, we couple a colloidal particle's positional coordinate with a constant chemical driving. Then the particle is kept far from equilibrium, resembling the dynamics of a renowned model of active particle 'active Ornstein-Uhlenbeck particle (AOUP)'.

Through this, we can describe how far the particle is deviated from equilibrium, not just from the statistical signature (breakage of fluctuation-dissipation relation), but from the clear energetic interpretation of the origin of activity. We think of an engine using this fuel-driven AOUP as its working substance.

Using the standard tool of 'stochastic thermodynamics', we successfully relate the heat dissipation (which is an energetic concept) with the entropy production (which is a probabilistic concept). Through this, we define a novel, 'thermodynamically consistent' concept of efficiency, which contains both heat injection and chemical fuel consumption in the denominator. This efficiency is properly bounded from above by the second law of thermodynamics.

A major advantage of this new efficiency is that we can address the effect of the 'parity' of particle's self-propulsion. The 'parity' means that whether the particle's self-propulsion does change its sign under time-reversal (odd-parity) or it does not (even-parity). Distinguished by a surprisingly simple criterion with clear meaning, engine with even-parity AOUP is efficient when the engine's spatial size is small, while the odd one is efficient when its spatial size is large.

If you are further interested, we welcome all your helpful comments, questions and exploration for future collaborations.

LinkedIn에서 이 글 보기 (English): 링크

Facebook에서 이 글 보기: 링크