학생들의 학업 성과를 예측하는 인공지능(AI) 모델은 정확도만큼이나 공정성과 예측 과정의 투명성이 중요합니다. 특히 학생의 인구통계학적 정보가 편향된 예측으로 이어질 위험이 있어, 이를 해결하기 위한 다각적인 연구가 진행되고 있습니다. 최근 한 연구에서는 강화 학습(Reinforcement Learning, RL) 기반의 다중 인스턴스 학습(Multiple Instance Learning, MIL) 시스템에 공정성과 설명 가능성을 통합하려는 시도가 있었지만, 원하는 만큼의 성과를 내지는 못했습니다.
이 연구는 학생의 교육 상호작용 데이터를 활용하여 '위험에 처한 학생'을 예측하는 것을 목표로 했습니다. 각 학생을 여러 상호작용 데이터(인스턴스)의 '묶음(bag)'으로 보고, RL 에이전트가 분류에 유용한 인스턴스를 선택하는 RL-MIL 방식을 사용했습니다. 여기에 적대적 편향 제거(adversarial debiasing) 기법과 사용자 선호도에 따라 성능과 공정성(Equalized Odds) 간의 균형을 조절할 수 있는 하이퍼네트워크(hypernetwork)를 결합했습니다. 그러나 실험 결과, 하이퍼네트워크를 통해 공정성-성능 간의 균형을 조절하려 할 때 '모드 붕괴(mode collapse)' 현상이 발생하여, 선호도 가중치를 변경해도 의도한 대로 공정성-성능 경계선을 따라 체계적인 변화가 나타나지 않았습니다. 이는 목표 간의 지배 관계, 조건화 메커니즘을 통한 약한 기울기 전파, 그리고 동적으로 생성되는 매개변수 간의 상호작용 때문으로 분석되었습니다.
이번 연구는 공정성 목표를 해석 가능한 RL-MIL 파이프라인에 통합할 수 있음을 보여주었지만, 단순히 선호도 조건화를 통해 다중 목표 행동을 제어하는 것은 쉽지 않다는 한계를 드러냈습니다. 즉, 견고하고 공정한 RL-MIL 시스템을 구축하기 위해서는 기울기 균형, 목표 분리, 그리고 안정성 분석을 위한 명시적인 메커니즘이 필요하다는 결론입니다. 이러한 연구 결과는 AI 모델이 실제 교육 현장과 같이 민감한 분야에서 윤리적이고 효과적으로 활용되기 위해서는 기술적 난제를 극복해야 함을 시사하며, 앞으로 더 정교한 다중 목표 최적화 기법의 개발이 중요함을 강조합니다.
