[연구] dxlab(지도교수 : 박은일), IJCAI 2026 1편, INTERSPEECH 2편 논문 게재 승인
- 실감미디어공학과
- 조회수406
- 2026-06-10
dxlab(지도교수 : 박은일), IJCAI 2026 1편, INTERSPEECH 2편 논문 게재 승인
Data eXperience Lab (dxlab, 지도교수: 박은일)의 논문이 인공지능과 음성처리 분야 top-tier 국제학술대회인 IJCAI 2026(1편)과 INTERSPEECH 2026(2편)에 게재 승인되었습니다.
제목: FedAMB: Adaptive Modality Balancing for Dominance-Robust Multimodal Federated Distillation
저자: 한승진, 이주엽, 이상민, 박은일
학술대회: International Joint Conference on Artificial Intelligence (IJCAI 2026, August 2026)
키워드: Multimodal Federated Learning, Federated Knowledge Distillation, Modality Dominance, Missing Modality Robustness
Multimodal Federated Learning은 여러 modality를 분산 클라이언트 환경에서 프라이버시를 유지하며 학습할 수 있지만, modality별 학습 난이도 차이로 인해 특정 modality가 학습을 지배하는 modality dominance 문제가 발생합니다. 본 연구는 선택적 modality 학습과 knowledge distillation을 통해 multimodal accuracy와 unimodal robustness를 함께 향상시킵니다.
핵심 기여
■ Contamination-Aware Modality Dominance 정의
Modality dominance를 Fed-KD의 global teacher contamination 문제로 재정의
■ Selective-Modality Regulation (SMR) 제안
Dominance state를 감지하고, 필요한 경우 선택적으로 weak modality 학습을 강화
■ Component-wise Modality Distillation (CMD) 제안
Global knowledge를 각 modality branch로 전달하여 unimodal robustness 향상

(a) FedAMB 프레임워크
그림 (a)는 FedAMB의 전체 프레임워크를 나타냅니다. 각 client는 먼저 modality dominance를 식별하고 SMR을 통해 local training을 조정한 뒤, proxy dataset에 대한 예측을 서버로 전달합니다. 서버는 이를 aggregation하여 global teacher를 구성하고, CMD를 통해 이 knowledge를 각 client의 modality branch에 distill함으로써 multimodal accuracy와 unimodal robustness를 함께 향상시킵니다.
제목: Temporal Transition-Aware Multi-Head Modeling for Partially Spoofed Audio Detection and Localization
저자: 김윤서, 이주엽, 박은일
학술대회: Interspeech 2026(September 2026)
키워드: Partially Spoofed Audio, Spoof Localization, Audio Boundary Detection
부분 조작 오디오 탐지(PSAL)는 하나의 발화 안에서 일부 구간만 가짜 오디오가 삽입된 경우, 이를 프레임 단위로 탐지하고 위치를 찾는 문제입니다. 기존 방법들은 주로 각 프레임의 진위 여부나 경계 예측에 집중했지만, 진짜 오디오와 가짜 오디오가 전환되는 순간의 시간적 변화를 충분히 활용하지 못했습니다. 본 논문은 인접 프레임 간의 시간적 변화를 핵심 단서로 활용하는 transition-aware localization framework를 제안하여, 가짜 오디오 구간의 시작과 종료를 더 정밀하게 탐지합니다.
핵심 기여
■ Transition-aware PSAL 관점 제시
기존의 frame-wise authenticity prediction이나 boundary label 중심 접근을 넘어, 인접 프레임 간 temporal transition을 부분 조작 오디오 localization의 핵심 단서로 활용하는 새로운 관점을 제안
■ Directional transition 기반 multi-head learning objective 제안
Real-to-Fake, Fake-to-Real과 같은 변화 방향을 명시적으로 학습하는 transition head와 frame-level score를 보정하는 refinement head를 결합하여, 조작 구간의 경계를 보다 정밀하게 탐지
■ 세 가지 PSAL 데이터셋에서 성능 검증
PartialSpoof, PartialEdit-E1, PartialEdit-E2 데이터셋에서 실험을 수행하여, 제안 방법이 기존 기법 대비 우수한 frame-level localization 성능을 달성함을 확인

- (a)Transition head와 refinement head
그림 (a) transition head는 각 프레임 쌍의 변화 양상을 분류하고, refinement head는 변화 정보와 프레임 독립적인 정보를 합쳐서 최종적으로 프레임을 분류합니다.

(b) 하나의 발화에 대한 2D PCA trajectory 시각화
학습된 모델의 feature를 분석한 결과, 진짜 오디오와 가짜 오디오가 시간적으로 구분되는 표현을 가짐을 확인할 수 있습니다.
제목: K-DIALECT: Korean Dialect-Aware Face-Based Speech Synthesis
저자: 양성연, 이주엽, 박은일
학술대회: Interspeech 2026(September 2026)
키워드: Speech Synthesis, Multimodal Text-to-Speech, Korean Dialects
Text-to-Speech는 주어진 텍스트를 읽는 발화 오디오를 생성하는 문제입니다. 기존 방법들은 정해진 음성으로만 텍스트를 읽거나 원하는 음성의 참고 오디오를 입력해야 했습니다. 하지만 원하는 대상에게 어울리는 음성을 자동으로 생성하는 연구는 부족했으며, 한국어 방언과 결합된 연구는 없었습니다. 본 논문은 원하는 대상의 이미지와 원하는 한국어 방언을 선택하면 대상에게 어울리는 음성으로 해당 방언으로 주어진 텍스트를 읽는 발화 오디오의 생성을 수행합니다.
핵심 기여
■ 대상과 어울리는 음성으로 발화 오디오 생성
기존의 참고 오디오를 활용하는 발화 오디오 생성을 넘어, style encoder와 ID encoder를 통해 대상의 이미지에서 얼굴의 특징을 추출하여 대상에게 어울리는 음성으로 발화 오디오 생성
■ 한국어 방언 발화 오디오 생성
서울, 강원, 경상, 전라, 제주, 충청 중 방언을 선택하면 T5 기반의 dialect translator와 pitch predictor를 통해 해당하는 방언으로 텍스트를 발화하는 오디오 생성
■ 객관적·주관적 지표를 통한 성능 검증
참고 오디오를 활용한 기존 방법론과 비교실험을 수행한 결과 객관적 지표 뿐만 아니라, 한국인을 대상으로 평가한 주관적 지표에서도 더 우수한 성능 달성

(a) K-DIALECT 프레임워크

(b) Pitch Predictor
(c)Image Encoder
그림 (a)는 텍스트와 대상의 이미지, 한국어 방언의 종류가 주어지면 대상에게 어울리는 음성으로 텍스트를 발화하는 오디오를 생성합니다. 그림 (b)는 방언의 종류에 따라 음성을 조정하고, 그림 (c)는 이미지에서 대상의 얼굴 특징을 추출합니다.
발전기금






