Evaluation Protocol Validity
우리가 쓰는 평가 프로토콜이 코딩 에이전트의 우열을 실제로 측정하는지, 프로토콜 선택만으로 기존 결론이 뒤집히는지를 다회 반복 실험으로 확인합니다.
Trustworthy AI-Assisted Software Engineering
Hankyong National University · SELAB
We study whether the tests, gates, and benchmarks software engineering already relies on still hold when the code is written by AI.
Research Program
SELAB은 AI가 생성한 코드가 실제 개발 파이프라인을 지날 때 무엇이 검증되고 무엇이 남는지를 연구합니다. 평가 프로토콜의 타당성, 테스트를 통과한 변경에 남는 잔여 결함, 저장소에 남는 위험 산출물, 검증 관문의 상호보완성을 각각 독립된 연구 질문으로 다룹니다.
우리가 쓰는 평가 프로토콜이 코딩 에이전트의 우열을 실제로 측정하는지, 프로토콜 선택만으로 기존 결론이 뒤집히는지를 다회 반복 실험으로 확인합니다.
테스트를 모두 통과한 AI 패치에도 실제 동작 실패가 얼마나 남는지를 행위 차이로 관찰합니다. 인수 테스트가 신뢰성의 근거가 되는 조건을 따집니다.
저장소를 통한 프롬프트 인젝션이 공격 성공에 그치는지, 코드베이스에 남은 위험 산출물이 개발 파이프라인의 검증을 그대로 통과하는지를 확인합니다.
테스트, 정적 분석, CI 검증처럼 서로 다른 관문이 정말 다른 결함을 잡는지, 어떤 조합이 비용 대비 효과가 있는지를 조건부 검출로 비교합니다.
지금 얻은 결론이 모델 세대가 바뀐 뒤에도 유지되는지를 반복 재현으로 추적하고, 모델 변화가 경험적 결론의 유효 기간을 어떻게 제한하는지 살펴봅니다.
AI가 코드를 더 빨리 쓰는지가 아니라, 그 코드를 신뢰할 근거가 무엇인지를 묻습니다.
How We Work
SELAB의 공용 AI R&D 인프라는 멀티-컴퓨트 노드로 운영됩니다. 아래 합계는 클러스터 전체의 통합 자원입니다.
Next
연구 의제, 구성원, 확정된 연구 성과와 협력 방법을 이어서 확인하세요.
Conference
Join us at The 42nd ACM/SIGAPP Symposium on Applied Computing in Gwangju, South Korea (April 5 - 9, 2027). Connect with global researchers and shape the future of applied computing.