CC
작업 목록으로

사이드 프로젝트 · 2026

AI 직원들이 운영하는 Threads 계정

해외 AI 소식의 수집·선별·작성·검증을 에이전트에게 맡기고 사람은 승인만 하는 계정 운영 시스템. 한 번 접었다가, 구조를 바꿔 다시 세웠습니다.

결과v1은 비용이 성과를 넘어 중지 → 구조를 바꿔 v2 재설계, 현재 자동 운영

역할
설계·구현·운영 단독
규모
24시간 682건 수집 · 누적 1,783건 · 게시 17건 · 폐기 591건
도구
Python·uv, 채점·작성 LLM, 결정적 린터, 텔레그램 승인봇
함께한 곳
Threads
AI 직원들이 운영하는 Threads 계정 작업 대표 이미지

밤사이 나온 소식을 아침에

해외 AI 소식은 대부분 한국 시간으로 밤에 나옵니다. 자고 일어나면 이미 흐름이 지나가 있습니다. 그래서 밤사이 나온 것들을 모아 아침에 배송하는 계정을 만들고, 수집부터 게시 후보 작성까지를 하나의 파이프라인으로 연결했습니다.

  • 수집 — 주요 연구소 블로그와 Hacker News, Reddit, 국내 AI 섹션. 미국 업무시간대에는 15분 간격, 그 외에는 느슨하게.
  • 중복 제거 — URL로 한 번, 제목·본문의 의미 유사도로 한 번 더 묶습니다. 여러 곳에 동시에 뜬 뉴스는 화제성 신호로 가점.
  • 작성과 문체 검문 — 생성문은 세 겹을 통과해야 합니다. 실제 사람이 쓴 글로 만든 문체 예시, 번역투·금지 표현·문장 리듬까지 잡는 결정적 검사기, 지적사항만 고쳐 쓰는 교정 패스. 세 번 고쳐도 통과 못 하면 폐기. 원문에 없는 숫자·고유명사는 코드가 대조해서 걸러냅니다.
  • 승인 — 마지막 게시 버튼은 사람이 누릅니다.

멈추라고 말한 숫자

비용을 관측하는 장치를 함께 두고 돌렸습니다. 얼마 뒤 지출이 성과에 비해 크다는 것이 수치로 확인됐고, 그 시점에 자동화를 중지했습니다. 만들 수 있는 것과 계속 운영할 가치가 있는 것은 다릅니다.

이 판단이 설계 입력이 됐습니다. 뉴스를 요약해 배송하는 계정은 더 큰 계정의 하위호환이 됩니다. 이 시스템만 할 수 있는 것은 따로 있었습니다. 파이프라인이 실제로 AI에게 일을 시켜보고, 그 성공과 실패의 로그를 공개하는 것입니다.

두 번째 시스템: 승인만 하는 편집장

그래서 계정의 정체를 바꿨습니다. AI 직원들이 해외 AI판을 뒤지고 실험까지 돌리면, 사람은 편집장으로서 승인만 합니다.

  • 실험실 — 같은 업무를 두 번 시킵니다. 한 번은 그냥, 한 번은 지시서에 한 줄을 보강해서. 1차 실패에 2차 통과면 결과를 가른 지시문을 공개하고, 둘 다 실패면 실패일지가 됩니다. 어떤 결과 조합에 어떤 글을 쓸 수 있는지 템플릿이 강제하고, 실행 로그에 없는 숫자는 검사기가 걸러냅니다.
  • 정직성 라벨 — 모든 글은 근거 수준을 밝힙니다. 직접 실행했는지, 문서로 교차검증만 했는지, 커뮤니티 반응인지, 아직 가설인지.
  • 선별 6축 — 새로움·한국 독자 체감·저장 가치 같은 여섯 축으로 채점하되, “AI에게 일을 더 잘 맡기게 되는 변화인가”를 최우선축으로 둡니다. 기준 미달은 작성 자체를 안 합니다.
  • 작성 — 훅이 다른 후보 세 개를 독립 생성하고, 심사 단계를 통과한 것만 승인 큐로 올립니다.
  • 승인 큐 — 텔레그램으로 초안이 도착하고, 게시·폐기·수정을 버튼으로 처리합니다. 손으로 고친 문장은 문체 예시 더미에 다시 쌓여, 갈수록 제 말투에 수렴합니다.

하루가 돌아가는 방식

Threads 계정 에이전트 구조. 뉴스 트랙과 실험 트랙이 작성 단계에서 합류하고, 문체 게이트를 지나 사람의 승인 큐로 갑니다. 두 트랙이 하나의 게이트로 모입니다. 코랄색 노드가 사람이 개입하는 유일한 지점이고, 왼쪽으로 돌아가는 점선이 제가 고친 문장을 문체 예시로 되먹이는 경로입니다.

수집부터 실험, 초안 작성까지가 정해진 주기로 알아서 돌고, 하루 두 건의 실험이 그 안에 포함됩니다. 제 하루의 개입은 텔레그램에 쌓인 초안을 열어 게시·폐기·수정 중 하나를 누르는 것뿐입니다. 수정을 누르면 제가 고친 문장이 문체 예시로 다시 들어가므로, 그 몇 초가 다음 글의 품질에 반영됩니다.

승인하면 게시까지 자동으로 이어집니다. 많이 들어온 날은 24시간에 682건이 수집됐고, 누적 1,700건이 넘는 수집분에서 실제 게시까지 간 글은 열일곱 편입니다.

버린 것 · 떨어진 지점

누적 1,783건이 들어와 게시된 건 17건입니다. 나머지가 어디서 떨어졌는지가 이 시스템의 실제 내용입니다.

  • 폐기 591건 — 채점 기준에 못 미쳐 작성 단계로 가지도 못한 것. “AI에게 일을 더 잘 맡기게 되는 변화인가”를 최우선축으로 두므로, 성능 수치만 바뀐 소식은 여기서 걸립니다.
  • 문체 게이트 반송 — 생성된 글이 번역투·금지 표현·리듬 검사에 걸리면 교정 패스로 돌아갑니다. 세 번 고쳐도 통과 못 하면 폐기.
  • 사실 대조 실패 — 원문에 없는 숫자나 고유명사가 들어간 글은 코드가 잡아냅니다. 실험 글은 실행 로그에 없는 숫자를 쓰지 못합니다.
  • 반려 67건 — 여기까지 통과해 제 앞에 왔는데 제가 안 올린 것. 사람이 마지막에 거르는 몫입니다.

통과율이 낮은 것이 이 시스템의 목적입니다. 무엇을 올리지 않을지 판단하는 구조가 이 프로젝트의 산출물입니다.