IT 전문가들이 모이는 해커 뉴스(Hacker News) 커뮤니티에서 과거 AI에 던졌던 다양한 도전 과제들이 현재 얼마나 달성되었는지에 대한 투표와 토론이 활발합니다. 이는 AI의 실제 능력을 평가하고, 'AI 효과(AI effect)'처럼 기술이 발전하면 할수록 기대치가 높아져 AI가 아니라고 치부하는 경향을 되짚어보는 계기가 되고 있습니다.
주요 논의 주제로는 '인간과 구별할 수 없는 코드 작성', '미해결 수학 문제 풀이', '튜링 테스트(Turing Test) 통과' 등이 있습니다. 일부 참가자들은 최신 대규모 언어모델(LLM)이 복잡한 코드베이스를 단시간에 이해하고 미묘한 오류를 찾아내는 능력에 놀라움을 표하며, 특히 연구 수준의 수학 문제를 독자적으로 해결하는 능력은 이미 달성되었다고 인정했습니다. 그러나 다른 한편에서는 AI가 생성한 코드가 아직 효율적이지 않거나 버그가 많고, 장시간의 집중적인 심문에는 여전히 인간과 구별된다는 반론도 제기됩니다. 무료 모델과 최상위 모델 간의 성능 격차가 AI 능력에 대한 인식 차이를 만든다는 지적도 나왔습니다.
이러한 논의는 AI 기술의 실제 발전 수준을 가늠하고, 미래 AI의 방향성을 예측하는 데 중요한 시사점을 제공합니다. 단순히 '할 수 있다/없다'를 넘어, '얼마나 안정적으로 반복 수행할 수 있는가'와 같은 실용적 관점에서의 평가가 중요해지고 있습니다. 또한, AI가 인간의 '귀찮은 집안일'을 대신하는 역할에 대한 기대와 함께, AI가 지식 노동의 상당 부분을 대체할 가능성에 대한 진지한 고민이 필요하다는 점을 보여줍니다. 결국 AI의 발전은 기술적 성취뿐만 아니라, 인간의 역할과 지능에 대한 근본적인 질문을 계속 던지고 있습니다.