AI 업무설계
조직 내 AI 도입, 인간-AI 협업, AI 네이티브 업무 방식을 다룬 노트입니다.
총 116개 노트
자가 진화인가, 제어 플레인인가 — Hermes와 OpenClaw를 가르는 진짜 질문
Hermes는 학습하는 에이전트이고 OpenClaw는 로컬 AI 제어 플레인이라는 비교는 어디까지 유효할까. 스킬, 메모리, 게이트웨이보다 먼저 정해야 할 운영 질문을 정리했다.
AI 에이전트의 천장은 검토다 — 하네스·루프·그래프를 한 번에 이해하기
하네스·루프·그래프는 서로를 대체하는 유행어가 아니다. AI가 일하는 환경, 반복하는 방식, 작업의 의존관계를 구분하고 자동화의 새 병목인 검토와 책임을 짚는다.
AI가 먼저 끊는 것은 일자리가 아니라 ‘첫 경력’이다
AI는 숙련자를 더 생산적으로 만들지만, 청년에게는 숙련을 시작할 입문 일자리부터 줄일 수 있다. KBS 보도를 통해 자동화 시대의 경력 사다리와 직업교육을 다시 생각한다.
데이터 에이전트는 첫 계획 하나에 모든 것을 걸면 안 된다
데이터 분석 에이전트가 여러 초기 계획을 먼저 만들고 일부를 골라 병렬 실행하는 CIPHER를 통해, 분석 자동화에서 탐색·선택·종합을 분리해야 하는 이유를 읽었습니다.
좋은 피드백은 전문가 점수만으로 완성되지 않는다
1,899명의 대학생과 2만여 편의 영어 글쓰기 초안을 통해, 교사가 높게 평가한 AI 피드백과 학습자가 실제로 쓰는 피드백이 왜 다를 수 있는지 읽었습니다.
봇이 팀원이 되는 순간, 조직의 규칙도 달라진다
2,991개 오픈소스 프로젝트의 봇 도입 전후를 따라가며, AI 에이전트의 효과가 자동화 자체보다 반복 협업·사회적 기억·역할 분화에서 생길 수 있다는 연구를 읽었습니다.
ChatGPT의 출처는 ‘좋은 글’보다 먼저 파이프라인을 탄다
ChatGPT가 웹 검색 여부를 먼저 분류하고, 여러 검색 파이프라인에서 자료를 가져온 뒤, 가져오기·인용·언급을 서로 다르게 처리한다는 브라우저 네트워크 분석을 읽었다. 중요한 건 단순한 AI 노출 요령보다 사실을 읽히는 형태로 두고 관찰과 일반화를 구분하는 일이다.
웹 에이전트는 클릭뿐 아니라 설명까지 남겨야 한다
웹 에이전트 벤치마크 MAG를 통해, 실제 화면 위에서 과업을 수행하는 능력과 다음 사용자를 위한 안내 문장을 함께 평가해야 한다는 점을 읽은 논문 메모입니다.
AI 튜터 평가는 시뮬레이션 다음의 교실을 봐야 한다
RAG와 지식 구성요소 모델을 결합한 AI 튜터 LEA의 실제 수업 배포와 교차 과목 확장성 평가를 HRD·교육평가 관점에서 읽은 논문 메모입니다.
AI 도입은 첫인상보다 사용 후 이동을 봐야 한다
공공기관 Microsoft 365 Copilot 8주 파일럿을 따라가며, 직원의 AI 수용 태도가 사용 전 기대에서 사용 후 재보정으로 어떻게 이동하는지 읽은 논문 메모입니다.
에이전트도 쉬운 일을 쉬운 일로 알아야 한다
LLM 에이전트가 간단한 수정에도 과하게 파일을 읽고 문맥을 모으는 문제를 ‘실행 중복’으로 보고, 먼저 난이도와 필요한 범위를 추정한 뒤 최소 경로로 검증하자는 E3 접근을 읽었다.
교육 대시보드는 점수보다 해석을 담아야 한다
학습분석 대시보드가 클릭·점수·완료율을 보여주는 화면을 넘어, 전문가가 학습자의 오개념과 판단 과정을 해석하는 인프라가 되어야 한다는 문제의식을 HRD 관점에서 읽었다.
AI 팀원도 실험 변수로 다뤄야 한다
AI를 팀에 넣을 때 필요한 것은 더 친절한 챗봇이 아니라, 말투·개입 빈도·기억·분석 로그를 재현 가능한 조건으로 다루는 실험 설계라는 점을 짚은 논문 메모.
GraphRAG의 병목은 검색보다 지식 정리 순서에 있다
GraphRAG를 한 번에 만들지 않고 추출, 중복 제거, 요약, 커뮤니티 탐지를 분리한 RAGU 논문을 실무 지식관리 관점에서 읽었다.
AI 채점은 종이를 없애는 일이 아니라 검토 지점을 좁히는 일이다
고등교육의 지필 시험을 완전히 디지털화하지 않고, 구조화된 답안과 비전 LLM 검증으로 채점 부담을 줄이는 하이브리드 평가 논문 메모.
AI 도입은 실험할 수 있는 조직에서야 성과가 된다
AI 도입을 성과의 원인으로 바로 놓지 않고, 감지 역량과 실험 역량을 거치는 조직 능력의 문제로 읽어본 논문 메모.
AI 시대에도 결국 남는 건, 자기 언어로 정의하는 힘
박용후 관점 디자이너의 세바시 강연은 AI 도구 사용법보다 먼저, 내가 무엇을 중요하게 여기고 어떤 단어로 세상을 정의하는지 묻는다. 공부, 관계, 글쓰기, 꾸준함이라는 네 기둥을 AI 시대의 삶의 태도로 다시 읽어본다.
스프레드시트 에이전트는 셀 하나보다 업무 전체에서 무너진다
비즈니스 스프레드시트 업무를 끝까지 수행하는 에이전트를 평가한 벤치마크 연구. 자동화의 병목이 수식 하나가 아니라 검사·수정·시각화의 전체 흐름에 있음을 보여준다.
평가 문항을 AI와 만들 때, 작은 모델이 더 현실적일 수 있다
교육평가 문항 설계에서 소형·로컬 언어모델을 대형 모델과 비교한 연구. 품질, 개인정보, 비용, 사람의 검토를 함께 보는 평가 업무 설계 노트.
에이전트 평가는 정답보다 실제 사용의 루프를 봐야 한다
에이전트를 평가하려면 한 번 맞혔는지보다, 실제 도구·파일·피드백 루프 안에서 어디서 막히는지 봐야 한다.
교육 데이터는 차트보다 이야기로 배워질 때가 있다
학습자가 차트를 못 읽는다고 탓하기 전에, 데이터가 어떤 순서와 이야기로 제시되는지 다시 설계해야 한다.
AI 도입은 신뢰보다 먼저 버틸 구조를 물어야 한다
AI를 윤리·정확도 문제로만 다루면, 서비스가 멈췄을 때 누가 어떻게 버틸지라는 더 현실적인 질문이 빠진다.
프롬프트가 아니라 계약으로 에이전트를 묶어야 한다
기업용 LLM 에이전트를 제품으로 쓰려면 좋은 프롬프트보다 출처, 라우팅, 출력 형식, 검증 흔적을 코드가 소유하는 계약 구조가 먼저 필요하다.
교육 AI는 강사를 대체하기보다 훈련 빈칸을 메운다
항공교통관제 훈련 시뮬레이터 ASTRA는 AI가 강사를 대체한다는 말보다, 반복 훈련과 평가의 빈칸을 어떻게 표준화하고 넓힐 수 있는지 보여준다.
자동화는 ‘얼마나 많이’가 아니라 ‘언제 넘길지’의 문제다
챗봇과 사람 상담원을 함께 쓰는 서비스에서, 자동화를 많이 하는 것보다 중요한 것은 대기열과 실패 가능성을 보며 언제 사람에게 넘길지 정하는 일이다.
에이전트 기억은 저장소가 아니라 개입 타이밍이다
장기 작업 에이전트에서 메모리를 더 많이 저장하는 문제가 아니라, 필요한 순간에 행동 루프에 다시 개입시키는 문제로 읽은 논문 메모.
AI 채점은 점수보다 피드백에서 먼저 써야 한다
K-12 평가에서 LLM 채점기를 검증한 논문을, 자동 채점의 가능성보다 평가 운영과 피드백 설계의 경계라는 관점에서 읽었다.
에이전트가 푼 일은 자동화 자산으로 굳혀야 한다
AI 에이전트를 매번 새로 추론하게 두지 않고, 반복 검증된 해결 경로를 결정적 워크플로로 전환하는 progressive crystallization을 읽는다.
교육평가는 쉬운 명령의 위험까지 봐야 한다
명령어 교육을 단순 난이도가 아니라 실제 시스템 영향까지 포함해 평가하려는 CogTax를, HRD·업무역량 평가의 관점에서 읽었다.
데이터 분석 AI는 표 하나보다 messy한 현장을 견뎌야 한다
DataGovBench 논문은 실제 공공데이터처럼 큰 다중 표, 메타데이터, 외부지식, 탐색적 인사이트가 얽힌 조건에서 LLM 데이터 분석 능력을 평가한다.
AI 코딩 협업은 대화보다 기여 흐름을 봐야 한다
오픈소스 저장소의 AI 대화 세션과 개발 이력을 연결해, 코딩 에이전트가 코드 작성·협업·유지보수 인식에 남기는 흔적을 읽은 연구를 업무 설계 관점에서 정리했다.
에이전트의 기억은 사실보다 판단 기록에서 먼저 오염된다
LLM 에이전트의 장기 기억에서 사실 지식뿐 아니라 과거 판단·추론 기록이 공격 표면이 될 수 있다는 FARMA와 SENTINEL 연구를 읽었다.
AI 피드백은 많이 쓰는 것보다 무엇을 놓쳤는지가 먼저다
학생 글쓰기 피드백 데이터셋 SEFORA와 평가 프레임워크 UniMatch를 통해, AI 피드백 자동화에서 양보다 우선순위와 누락을 봐야 한다는 점을 읽었다.
전문가의 수정은 채팅 로그가 아니라 팀 기억이 되어야 한다
AI 번역 워크플로에서 사람의 개입을 일회성 수정이 아니라 팀이 다시 쓸 수 있는 근거와 선례로 남기는 방법을 읽었다.
LLM을 매번 부르지 않고, 작은 함수로 남기는 상상
자연어로 적은 애매한 업무 함수를 작은 로컬 실행 아티팩트로 컴파일하는 Program-as-Weights 논문을 읽고, 에이전트·RAG·자동화 설계의 실행 비용과 재현성 문제를 정리했다.
AI 채점은 모델보다 루브릭이 먼저다
Linux/bash 단답형 시험 1,200개를 네 개 LLM과 사람 채점자 기준으로 비교한 연구를 읽고, AI 채점을 어디까지 자동화하고 어디서 사람 검토를 남겨야 하는지 정리했다.
AI 팀이라고 부르기 전에, 먼저 어떤 팀인지 물어야 한다
인간-AI 팀 연구 53편을 다섯 가지 팀 유형으로 나눈 논문을 읽고, 조직의 AI 도입에서 ‘AI를 팀원으로 쓴다’는 말을 더 정확하게 쓰는 법을 정리했다.
RAG가 맞게 찾았어도, 오래된 지식이면 실패다
에이전트가 검색한 지식의 출처, 버전, 승인 상태, 재현 가능성을 관리해야 한다는 ContextNest 논문을 읽었다.
AI가 코드를 빨리 쓰면, 리뷰는 어디서 막히는가
기업의 AI 코딩 도구 의무 도입이 실제 개발 흐름에서 무엇을 바꾸는지, 802명 개발자와 19만 건 이상의 PR 데이터를 추적한 논문을 읽었다.
에이전트가 일을 끝냈어도, 제대로 배운 것은 아닐 수 있다
LLM 에이전트의 스킬 사용을 최종 성공 여부만으로 평가하지 말고, 선택·준수·조합·성찰 과정을 나눠 보자는 SkillCoach 논문을 읽었다.
교육 AI는 ‘도와줄 학생’보다 ‘건드리지 않을 학생’을 먼저 배워야 한다
학습분석 기반 교육 상담에서 제로샷 LLM과 RAG가 불필요한 개입을 과잉 추천할 수 있음을 보인 논문을 HRD·평가 자동화 관점에서 읽었다.
AI 협업의 차이는 모델보다 사람의 태도에서 갈린다
예측 과제에서 인간-AI 협업의 평균 효과보다 더 중요했던 것은 관점수용, 지적 겸손, 호기심 같은 협업 역량이었다는 파일럿 연구를 읽었다.
에이전트의 기억은 쌓는 것보다 옮겨 쓰는 법이 어렵다
반복 업무를 수행하는 LLM 에이전트에서 절차적 기억이 언제 일반화되고 언제 특정 역할에 과적합되는지 평가한 AFTER 벤치마크 논문을 읽었다.
AI 교육은 사용법보다 신뢰를 설계해야 한다
생성형 AI 시대의 직무교육은 도구 사용법 전달이 아니라 직원이 자기 경험 위에서 AI를 신뢰하고 검토하며 쓸 수 있게 만드는 변화관리라는 논문을 읽었다.
AI를 쓰는 판단은 결국 사람의 눈에서 갈린다
AI가 디자인 업무에 들어올 때 실제 책임은 도구가 아니라 결과물을 판단하고 조직 안에서 통과시키는 사람의 보이지 않는 노동에 남는다는 연구를 읽었다.
에이전트가 일을 못 끝내는 이유는 지능보다 대화 구조에 있다
코딩 에이전트를 한 번에 완성하는 도구가 아니라, 모호한 요구를 사용자와 함께 발견하고 고쳐가는 협업자로 평가해야 한다는 논문을 읽었다.
기억하는 에이전트에게는 ‘무시할 줄 아는 능력’이 필요하다
장기 기억을 가진 AI 에이전트가 사용자의 과거 말에 과도하게 맞춰 사실성과 판단을 잃는 문제를 다룬 벤치마크 논문을 읽었다.
평가표는 점수가 아니라 사람이 놓칠 장면을 붙잡아야 한다
멀티모달 모델 평가를 사람의 지각에 가까운 세부 루브릭으로 다시 설계하려는 논문을 HRD·평가 자동화 관점에서 읽었다.
표를 읽는 AI는 정답보다 근거 위치를 먼저 틀린다
LLM이 표 구조를 이해해도 실제 값의 위치를 잘못 인용하거나 빠뜨리는 데이터 참조 오류를 분석한 논문을 데이터·평가 자동화 관점에서 읽었다.
AI에게 공부시키기 전에, 무엇을 질문하게 할지 봐야 한다
문서로부터 질문-답변 데이터를 스스로 만들게 하는 학습 방식이 어떤 편향과 프롬프트 인젝션 취약성을 갖는지 살핀 논문을 HRD와 지식관리 관점에서 읽었다.
규정은 프롬프트가 아니라 실행 가능한 기준이어야 한다
조직 정책을 LLM에게 한 번에 판단시키지 않고, 추출 질문과 규칙 엔진으로 나누어 문서 검토를 더 점검 가능하게 만드는 PolicyGuard 논문을 Deciflow 관점에서 읽었다.
복잡한 멀티에이전트가 늘 좋은 것은 아니다
README 자동 생성 실험을 통해, 단일 에이전트 RAG와 멀티에이전트 RAG, 개발자 계획 개입 방식의 품질·비용 차이를 비교한 논문을 실무 자동화 관점에서 읽었다.
AI 평가 시스템의 병목은 문항을 많이 만드는 것이 아니라 오래 건강하게 관리하는 일이다
Duolingo English Test의 AQuAP 사례를 통해, AI 기반 평가에서 문항 생성보다 더 중요한 문항 은행 건강성, 노출, 편향, 리뷰 흐름의 지속 모니터링을 읽었다.
AI 네이티브 엔지니어는 코드를 덜 쓰는 사람이 아니라 책임 경계를 설계하는 사람이다
AI 에이전트가 코드를 쓰기 시작할 때 엔지니어의 일은 구현량보다 워크플로, 평가, 개입 조건, 책임 경계를 설계하는 쪽으로 이동한다는 논문을 업무 설계 관점에서 읽었다.
RAG 메모리에서 더 위험한 것은 잊는 것이 아니라 오래된 사실을 믿는 일이다
AI 에이전트의 장기기억을 RAG 검색 문제로만 다루면, 최신 사실과 낡은 사실을 구분하지 못하는 구조적 문제가 생긴다. 시간 유효성이라는 관점에서 업무용 에이전트 메모리를 읽었다.
AI 업무의 피로는 답이 아니라 타이핑 사이에 남는다
LLM 협업의 성패를 답의 품질만으로 보지 않고, 사용자가 프롬프트를 쓰는 동안 남기는 멈춤·수정·속도 같은 신호로 업무 부담을 읽어보려는 연구를 정리했다.
GUI 에이전트는 클릭보다 과제 기억을 배워야 한다
웹 GUI 에이전트가 반복 업무를 잘하려면 원자적 클릭 기술보다 과제 수준의 계획 경험과 사후 경험 재구성이 중요하다는 PEEU 연구를 실무 자동화 관점에서 읽었다.
AI 도입은 교육보다 먼저 안전감을 요구한다
2,257명 직원 설문을 바탕으로 심리적 안전감이 AI 도입 여부와는 관련되지만, 도입 이후 사용 빈도·시간까지 설명하지는 못한다는 결과를 HRD 관점에서 읽었다.
업무 AI는 대답보다 증거 찾는 습관이 먼저다
사내 문서 더미에서 AI 에이전트가 실제로 증거를 찾고, 단위와 용어를 맞추고, 계산까지 할 수 있는지를 묻는 벤치마크 AGORA를 업무설계 관점에서 읽었다.
검색어를 만드는 AI는 보상 설계에서 무너진다
LinkedIn의 산업용 의미 검색 사례를 통해 RLAIF 기반 검색어 생성에서 보상 해킹과 규칙 기반 안전장치가 왜 중요한지 읽는다.
AI 튜터는 친절함보다 어느 순간에 도와야 하는지가 먼저다
LLM 기반 학습 에이전트를 교육 이론과 진단 전략에 맞춰 설계해야 한다는 논문을 HRD·교육평가 관점에서 읽었다.
AI 에이전트 도입은 사용률보다 위임의 깊이를 봐야 한다
Codex 사용 데이터를 통해 에이전트형 AI가 단순 질의 도구에서 위임·검토·병렬 실행의 작업 시스템으로 이동하는 조건을 읽는다.
성능을 재기 전에, 실패를 어떻게 볼지 정해야 한다
Large language models (LLMs) are increasingly being integrated into mental health support tools and other psychologically sensitive conversational applications. In such…
AI 대시보드는 답보다 판단의 화면을 바꾼다
The use of Generative AI Conversational User Interfaces (CUI) as a new way to access and analyze data is growing in all sectors, and the industrial one is no exception.…
AI 에이전트는 도구보다 실행 환경을 먼저 필요로 한다
AI agents are driving a new software paradigm, with the ability to autonomously call tools, extract information, manage memory, and complete tasks that span application…
문서 자동화의 핵심은 추출보다 판정 근거다
독일 중앙은행 담보 적격성 검토 사례를 통해, 긴 문서 업무에서 LLM 자동화가 추출-정규화-해석-검증의 운영 구조로 설계되어야 함을 읽는다.
AI 채점은 점수보다 ‘넘길 때’를 알아야 한다
학생 그림 평가 자동화 논문을 통해, 교육평가와 HRD 평가에서 AI가 점수만 내는 도구가 아니라 언제 사람에게 넘길지 판단하는 구조가 되어야 함을 읽는다.
AI 사고는 작은 설계 착각에서 시작된다
직장 AI 사고를 '성능 부족'이 아니라 노동자 필요와 개발자 설계 사이의 어긋남으로 읽어본 논문 메모.
데이터셋도 이제 에이전트가 실험한다
Autodata 논문을 통해, 합성 데이터를 한 번 생성하는 일이 아니라 검사·평가·개선 루프를 돌리는 에이전트형 데이터 과업으로 읽은 작업 메모.
좋은 AI 코치는 언제 물러날지 안다
드론 레이싱 사용자 연구를 통해, AI 코칭이 즉각적 수행보다 독립적 숙련을 목표로 할 때 무엇이 달라지는지 읽은 작업 메모.
AI 도입은 직무를 없애기보다 경계를 흐린다
SAP BTP 맥락의 인터뷰와 워크숍을 통해, AI가 기업 소프트웨어 사용자 역할을 어떻게 넓히고 겹치게 만드는지 읽은 작업 메모.
주니어에게 ‘AI 먼저 물어봐’라고 말하기 전에
AI가 단순 업무를 줄인 뒤 남겨둔 것은 더 빠른 판단 요구였다. 주니어 번아웃을 개인 역량 문제가 아니라 조직의 성장 사다리 문제로 읽어본다.
에이전트 기억은 검색창이 아니라 운영 시스템이다
에이전트 메모리를 단순 RAG가 아니라 저장·추출·검색/라우팅·유지보수 모듈을 가진 데이터 관리 시스템으로 평가해야 한다는 논문을 업무 자동화 관점에서 읽었다.
요구사항은 AI에게 맡기기 전에 사람이 같이 헷갈려야 한다
요구사항 도출에서 AI 단독 생성보다 이해관계자 협업과 AI 합성이 만났을 때 산출물 평가가 더 좋았다는 실험을, 조직의 AI 업무설계 관점에서 읽었다.
완벽한 내 편이 위험해질 때
엠빅뉴스 영상 『우리 모두 AI에 취약할 수밖에 없어요』를 보고, AI가 정서적 공감과 확신을 끝없이 돌려줄 때 왜 현실 검증 장치가 더 중요해지는지 남긴 메모.
에이전트 권한은 토큰보다 의도에 먼저 묶여야 한다
AI 에이전트가 도구를 호출할 때 기존 토큰 권한만으로는 부족하다는 문제의식. 사용자의 현재 요청 의도를 서버 쪽 정책 속성으로 삼아 도구 목록과 실행 효과를 좁히는 IGAC 아이디어를 업무 자동화 관점에서 읽었다.
수업 몰입도를 AI로 재기 전에, 프롬프트 흔들림부터 봐야 한다
교실 몰입도 인식을 VLM으로 자동화할 때 개인 단위 판정은 거의 무작위에 가깝고, 프롬프트만 바뀌어도 결과가 크게 흔들릴 수 있다는 벤치마크 연구. 교육평가 자동화의 안전한 단위를 묻는다.
AI 추천이 붙으면 사람의 검토 시간도 흔들린다
AI 이력서 추천이 결과만이 아니라 사람이 누구의 이력서를 얼마나 오래 보는지까지 바꿀 수 있다는 연구. 채용·평가 AI를 도입할 때 결과 지표만 보면 놓치는 절차적 공정성의 신호를 짚는다.
업무 자동화는 문서 검색보다 절차 기억에 가깝다
GraphMind는 과거 운영 사고 해결 흔적에서 문제-행동 그래프를 만들고, 에이전트가 그 그래프를 따라 업무 절차를 실행·갱신하게 하는 연구다. RAG보다 절차 기억을 설계해야 한다는 점에서 Deciflow 자동화에 직접 연결된다.
AI가 누구에게 더 도움이 되는지 먼저 물어야 한다
AI 보조가 모두에게 같은 생산성 향상을 주는 것이 아니라, 기본 역량과 자기 판단의 보정 정도에 따라 다르게 작동한다는 점을 방사선 판독 데이터로 다시 확인한 논문 메모.
빠른 RAG는 질문이 언제 안정되는지부터 봐야 한다
Streaming RAG가 항상 빨라지는 기술이 아니라, 사용자의 질문 의도가 입력 중 언제 안정되는지에 따라 이득이 갈린다는 분석을 실무 자동화 관점에서 읽었다.
AI 채점은 점수보다 먼저, 무엇을 읽고 있는지 물어야 한다
LLM이 에세이 품질을 내부 표현으로 어느 정도 포착한다는 분석을, 교육평가·HRD 평가 자동화에서 신뢰와 검토 기준을 세우는 문제로 읽었다.
AI를 빌려 쓴 만큼, 검증할 힘도 같이 갚아야 한다
AI가 단기 생산성을 높일수록, 사람이 직접 검증하고 재구성하는 능력이 보이지 않는 부채처럼 줄어들 수 있다는 모델을 조직 AI 도입 관점에서 읽었다.
에이전트에게 기억보다 먼저 필요한 것은 장부다
도구 호출 에이전트가 오래된 정보나 정책 위반으로 실패하지 않도록, 프롬프트 안 기억 대신 별도 상태 장부와 정책 게이트를 두는 LedgerAgent 논문을 읽었다.
AI 면담은 설문지가 놓치는 말의 결을 붙잡을 수 있을까
AI가 반구조화 면담을 진행하면 설문조사의 규모와 인터뷰의 깊이를 동시에 조금씩 가져올 수 있는지, 그리고 HR·조직 진단에서 무엇을 조심해야 하는지 읽었다.
에이전트 보안은 차단보다 확률의 상한을 관리하는 일이다
도구 호출 AI 에이전트의 보안 정책을 확률적 불확실성 속에서 검증하는 논문을 읽고, 업무 자동화에서 ‘위반 확률의 상한’을 관리하는 방식을 생각한다.
AI 도입은 이사회가 아니라 직원의 자리에서 검증된다
에이전트형 AI 도입을 이사회 의무와 직원 이해관계의 문제로 다시 읽는다. 효율화 결정보다 먼저 물어야 할 것은 대체되는 일, 재교육, 참여 절차다.
AI 에이전트 UX는 예쁜 화면보다 진행 상황을 보이게 하는 일이다
기업 업무에 AI 에이전트를 넣을 때 사용자가 원하는 것은 단순한 자동화가 아니라 통제, 책임, 데이터 출처, 다음 행동이 보이는 상호작용이다. 이 논문은 비즈니스 맥락의 인간-AI 에이전트 UX 기준을 묻는다.
AI 팀워크의 병목은 사람 수가 아니라 인수인계다
공유 작업공간에서 사람과 AI 에이전트가 함께 일할 때, 더 많은 전문성이 자동으로 더 나은 결과를 만들지는 않는다. 이 논문은 협업 구조와 책임 신호가 성과를 어떻게 바꾸는지 묻는다.
에이전트에게 일을 맡기려면 흔적부터 보여야 한다
과학 연구 에이전트의 실행 과정을 그래프로 기록·시각화하는 연구를 읽고, 업무 자동화에서 최종 산출물보다 중간 흔적을 설계해야 하는 이유를 정리한다.
AI 도입은 도구 전환이 아니라 신뢰 전환이다
HR 지식검색 전환 사례를 바탕으로, 생성형 AI 도입이 왜 시스템 교체가 아니라 역할·검증 습관·조직 신뢰를 다시 설계하는 문제인지 정리한다.
딥리서치 에이전트는 질문보다 평가 기준을 먼저 지어야 할 때가 있다
딥리서치 에이전트를 업무에 쓰려면 좋은 질문보다 먼저 좋은 평가 기준과 증거 구조가 필요하다. 루브릭 기반 자동화 설계를 논문으로 읽는다.
AI와 협업한다고 말하기 전에, 역할부터 다시 봐야 한다
인간-AI 협업이라는 말을 실제 협업으로 부르려면 무엇이 필요한지 따져보는 논문이다. 업무 AI 도입에서도 ‘협업’이라는 좋은 말보다 상담, 위임, 지시, 공동 추론의 차이를 먼저 구분해야 한다.
AI 에이전트의 위험은 실패보다 그럴듯한 보고서다
운영 중인 LLM 에이전트에서 조용한 실패가 어떻게 그럴듯한 이야기로 바뀌는지 추적한 사례 연구다. 자동화 운영에서 필요한 것은 더 많은 테스트만이 아니라 사람이 볼 수 있는 실패 신호다.
동료가 된 AI에게는 작업장이 필요하다
AI가 챗봇에서 디지털 동료로 넘어가려면 기억, 작업공간, 검증 루프, 권한 위임이 함께 필요하다. 인간-AI 협업을 업무설계 관점에서 읽는다.
AI 도입보다 어려운 것은, 일을 다시 짜는 일이다
Microsoft Work Trend Index 2026을 바탕으로, AI 에이전트 도입이 도구 문제가 아니라 운영모델·판단·리더십·학습 시스템의 문제임을 정리한다.
AI 도입의 다음 질문은 ‘썼는가’가 아니라 ‘성과가 났는가’다
AI 전환이 도입 경쟁에서 ROI와 조직성과 검증 단계로 넘어가고 있다. AX를 업무설계와 성과관리 관점에서 다시 읽는다.
AI 제국의 위험은 기술보다 돈의 흐름에서 온다
AI 산업의 성장 서사를 기술 낙관론이 아니라 데이터센터, 외부 자금조달, 레버리지, 현금흐름의 문제로 다시 읽어본 작업 메모입니다.
RAG 문서가 많아질수록 먼저 좁혀야 한다
문서가 많아질수록 RAG 검색 품질이 오히려 희석될 수 있다는 연구를 바탕으로, 업무 지식관리와 검색 설계에서 먼저 좁혀야 할 기준을 정리한다.
채용 AI에서 중요한 것은 점수가 아니라 판단의 흔적이다
LLM 에이전트로 후보자 평가와 순위를 만드는 연구를 채용 자동화가 아니라 평가 기준, 설명 가능성, 인간 검토 구조의 문제로 읽었다.
AI 동료와 일할수록 코딩보다 검증이 일이 된다
생성형 AI와 에이전트가 소프트웨어 일을 코드 작성량이 아니라 의도 지정, 검증, 통제, 책임의 문제로 바꾸고 있음을 업무설계 관점에서 읽는다.
앱 만들기는 쉬워졌지만, 팔리는 앱은 아직 어렵다
15년차 개발자가 퇴사 후 한 달 동안 AI와 Codex로 앱 30개를 만들고 15달러를 번 실험을 보며, AI 시대의 개발 생산성과 유통·수익화의 간극을 정리한 작업 노트.
미션이 상사가 될 때, 조직은 정치보다 일에 가까워진다
젠슨 황의 유퀴즈 인터뷰를 보며, 엔비디아의 성장담보다 더 오래 남은 ‘Mission is the boss’, 회복탄력성, 관대함, 한국 게임 문화와의 연결을 조직 운영 관점으로 정리한 노트.
에이전트 메모리는 검색보다 실행 상태를 지키는 일에 가깝다
장기 과제를 수행하는 AI 에이전트에게 메모리는 유사도 검색이 아니라 실행 상태 관리라는 관점의 논문 메모.
AI가 너무 유능할 때, 일의 주인은 흐려질 수 있다
인간-AI 협업을 성과가 아니라 소유감, 의미감, 동료의 시선으로 다시 읽어본 논문 메모.
로컬 LLM은 한 대의 컴퓨터가 아니라 개인 지식망이 될 수 있다
Obsidian 노트, LLM Wiki, 로컬 LLM, Tailscale을 연결하면 내 노트 기반 AI를 여러 기기에서 쓸 수 있다. 개인 세컨드 브레인을 서비스처럼 쓰는 방식에 대한 작업 메모.
협업 AI는 똑똑한 답보다 설명 가능한 행동 규칙이 필요하다
LLM 추론을 실행 가능한 정책 트리로 증류해 인간-AI 협업의 해석 가능성과 속도를 함께 얻으려는 Co-π-tree 논문을 Deciflow 자동화 관점에서 읽은 노트.
AI 도입은 정책보다 먼저 동료의 압력으로 퍼질 수 있다
방글라데시 기자 23명 인터뷰를 바탕으로, 공식 정책과 교육이 거의 없는 상황에서도 GenAI 사용이 동료 압력과 직업적 필요로 확산되는 과정을 UTAUT 관점에서 읽은 논문 메모.
AI 도입의 병목은 나이보다 권한과 불안에 있다
2,257명의 전문직 설문을 바탕으로, 직장 내 AI 채택을 직급·경험·지역·불안·자기효능감으로 다시 읽은 논문 메모. AI 전환의 핵심은 교육만이 아니라 권한과 심리적 안전감을 설계하는 일이다.
AI 네이티브 팀은 사람 수보다 피드백 루프를 늘린다
YC 파트너 Diana Hu의 이야기를 바탕으로, AI를 개인 생산성 도구로 쓰는 팀과 회사 운영체제에 내재화하는 팀의 차이를 정리했다. 핵심은 더 많은 AI 사용량이 아니라, 회사가 AI에게 읽히는 구조가 되는 것이다.
미국은 제조업보다 AI 자산경제를 지키려는 것 아닐까
유신익 박사의 지식뉴스 인터뷰를 보며, 미국의 제조업 부활 담론을 AI·달러·자산가격 방어 전략이라는 관점에서 다시 읽어봤다.
세컨 브레인은 노트앱이 아니라, AI가 참조할 나의 운영체제다
옵시디언·깃허브·LLM 위키를 개인 컨텍스트 운영체제로 바라보며, 여러 AI 도구에 매번 맥락을 설명해야 하는 문제를 어떻게 줄일지 정리한다.
AI가 답을 빨리 만들수록, 컨설턴트는 문제를 더 오래 붙잡아야 한다
AI가 자료조사와 문서작성 속도를 높일수록, 컨설턴트의 역할은 답안 작성보다 문제정의·이해관계 조율·실행 가능한 판단으로 이동한다.
AI 동료와 일하면, 사람은 더 많이 만들지만 더 비슷해진다
AI 에이전트와 협업한 팀은 생산량과 텍스트 품질을 높였지만, 이미지 품질과 산출물 다양성에서는 다른 경계가 드러났다. 이 논문은 AI 도입보다 먼저 협업 구조를 설계해야 한다는 질문을 남긴다.
프롬프트보다 중요한 건 이제 ‘루프’다
프롬프트를 잘 쓰는 사람에서, AI가 스스로 검증하고 고치고 증거를 제출하게 만드는 작업 시스템 설계자로 역할이 이동하고 있다는 생각을 정리했다.
AI 시대, 40대에게 필요한 건 두 번째 축적이다
신수정 전 KT 부사장의 인터뷰를 보며, AI를 잘 쓰는 개인보다 일을 다시 설계하는 리더와 자기 일을 밖으로 발산하는 사람이 더 오래 남는다는 생각을 정리했다.