Contrastive Learning with Variational Regularization for Multi-Session EEG-to-Speech Decoding
- 발행일
- 출처
- arXiv
- 논문 번호
- 933
- 분야
- Research
- arXiv 번호
- 2608.16360
같은 일본어 문장을 다른 날 들을 때 측정한 EEG를 한 쌍으로 묶어, 측정 회차의 흔적을 줄이면서 말소리 내용을 복원하려는 방법이다.
이 논문은 한마디로 날짜와 전극 위치에 따라 달라지는 EEG 신호에서 말소리 정보를 더 안정적으로 읽는 방법을 제안한다. 같은 참가자가 같은 문장을 다른 회차에서 들은 EEG를 같은 것으로 묶는 대조 학습과 잠재 공간을 넓게 유지하는 변분 정규화를 결합한다. 확률 잠재 변수는 학습 손실에만 쓰고 실제 음성 디코더에는 넣지 않는다. 한 참가자의 일본어 듣기 자료에서 문자 오류율은 기준 0.968에서 0.948로 낮아졌고, 회차 분류 정확도는 우연 수준과 구별되지 않는 2.08퍼센트로 내려갔다. 그러나 오류율 자체가 매우 높고 한 사람만 평가해 실제 음성 복원이나 사람 간 일반화를 보여준 것은 아니다.
핵심 요약
- SpREAD 자료는 한 참가자가 화자 18명의 일본어 1,353문장을 들은 EEG다. 각 문장을 서로 다른 날 세 번 측정해 9일 동안 45개 회차를 구성했다.
- 학습, 개발, 평가 표본은 각각 3,195개, 432개와 432개다. 같은 문장의 세 반복 측정은 항상 같은 분할에 넣었다.
- 평가 표본 432개에서 문자 오류율 0.948은 기준 0.968보다 유의하게 낮았다. 학습 표본으로 회차 분류기를 학습하고 개발 표본에서 측정한 정확도는 2.08퍼센트로 우연 수준 2.2퍼센트와 차이가 없었다.
- 대조 학습만 쓰면 음향 상관계수가 0.282에서 0.262로 나빠졌다. 변분 정규화를 더하면 0.274로 회복됐지만 기준보다 좋아진 것은 아니며 화자 정보 향상도 유의하지 않았다.
- 참가자가 한 명이고 화자 18명은 학습과 평가에 공통으로 들어간다. 들은 일본어만 다뤘고 현재 EEG 음성 복원 정확도는 실용 수준과 거리가 멀다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.