影像判讀

一資料夾照片要一張張看到眼花——這樣用 AI 先挑出可疑的,最後一眼還是人看

同一件事,四種投入程度:從「丟一批照片、貼一段指令請它初步分類並標信心」,一路到「訓練專屬判讀模型、只把沒把握的送人複核」。想快有快的、想長遠有長遠的,按需要往上爬——但不管哪一階,最終認定都留給人。

情境:品檢/盤點/現場照方法:需求 → 方案 · 逐項拆解法2026-07-30

還沒用過 AI?免費版就能試,不用付錢——先看 30 秒新手上路 →

這問題你八成也遇過

一整個資料夾的照片——產品有沒有瑕疵、貨物有沒有損壞、現場有沒有異常、單據有沒有拍糊——要一張張看到眼花。看到第 200 張,眼睛已經自動放水了,真正有問題的那幾張反而被滑過去。你想用 AI 幫忙篩,可是心裡毛毛的:萬一它看錯,把有問題的當沒問題放過去,是要出事的。

難的不是「會不會用 AI 看圖」——它早就看得懂。難的是怎麼讓它只當你的第一道篩子,而不是替你拍板

只想馬上動手?跳到第 1 階(免費就能做)——下面「AI 為什麼會看走眼」的道理,之後回頭看也行。

先想 · AI 在這裡最容易犯什麼錯

AI 看圖辨識這兩年進步很多,但它有一個要命的毛病:看走眼的時候,語氣跟看對的時候一模一樣,都很有把握。 反光把刮痕蓋住了,它可能回你「正常」;光線太暗,它可能把陰影當污漬報你「疑似瑕疵」——它不會說「這張我看不清、我猜的」,它只給你一個乾脆的答案。一份看起來很篤定、其實是猜的判讀結果,比一句「我不確定」危險得多。

所以重點只有一句:不能讓 AI 下最終判斷,只能讓它「先分堆、並老實招出哪些它沒把握」。

AI 老實說:這段講的就是我自己。你把一批照片丟給我,我最會坑你的地方,是我看不清的時候也會給你一個很乾脆的答案。而且你沒看過的新型號,我根本沒有它的合格標準,卻還是會硬套一個類別給你。所以請這樣用我:叫我每一張都標把握程度、把沒把握的單獨列出來別替你做「報廢/放行」這種要負責任的決定。最終那一眼,一定要是人。你把我綁在「初篩」這個位置,我才真的幫得上忙。

它具體會怎麼坑你?五個品檢/盤點現場真的會發生的例子:

你丟進去的照片AI 可能自作主張但其實是…
反光很強、亮到發白的產品照判「正常·高信心」反光把刮痕蓋掉了,它是看不到、不是沒有
光線很暗、一片陰影的角落把陰影當污漬,判「疑似瑕疵」只是沒打光,東西是好的
你這次才進的新型號硬套舊型號的標準說「正常」根本沒有這型號的合格標準,在瞎猜
同一箱貨只拍到正面幾張回「這箱都檢查過了、沒問題」背面、底部死角根本沒入鏡,它看不到的它不會提
一張圖裡擺了兩件產品只判斷比較顯眼那件另一件的瑕疵被忽略,你以為兩件都看過了

看出來了嗎?每一個「錯」都長得很像對的——它不是不會看,是看不清、沒看過、沒拍到的時候,還是給你一個乾脆的答案。這就是為什麼下面每一步,都要先逼它把「沒把握」講出來。

解方 · 每一次都要做的四個步驟

  1. 先定標準、先小批試:別讓 AI 自己猜「什麼叫瑕疵」。先用一句話講清楚你要分幾類、每類長怎樣(例:「刮痕、缺角、印刷歪掉算『疑似』;只是灰塵、反光不算」),先丟一小批(5~10 張)看它抓得準不準,準了再放大。
  2. 逼它標信心、列低信心:要它每張都標把握程度(高/中/低),並把「低」的單獨列成一份清單。明確叫它:看不清、拍糊、沒把握的寧可標低,也不要硬給答案——這句話是整篇的關鍵。
  3. 原圖不動、結果另存清單:判讀結果讓它列成一份對照清單(哪張檔名→哪一類→信心高低),你另存一份;別叫 AI 幫你「把 NG 的照片刪掉/搬走」——分類歸分類,動檔案是人確認後的事,刪錯了照片不像數字,救不回來。
  4. 人複核低信心+高信心抽驗:人力集中看那份低信心清單,最終「合格/報廢」由人認定;高信心那批也每類抽 5~10% 回頭對原圖,對得起來才算數。別因為它說「高信心」就整批放行。
STEP 1丟一批照片
STEP 2AI 初步分類
STEP 3標信心列低信心
STEP 4人複核低信心

四種做法:從「五分鐘上手」到「一套系統」

上面那四個步驟,是你每次判讀都要做的事。下面這四個層級,是「你想把這套做到多自動、多長遠」——是兩回事,別搞混。

只想解決這一次直接看第 1 階就好,第 2~4 階等你之後想更省事再回來。

先對號入座,再往下讀:

你的情況適合
偶爾一批、想馬上有結果第 1 階
每週/每月都在看同一類照片第 2 階(多數人停這就夠)
照片固定放某個雲端資料夾、想少搬檔第 3 階
天天大量、要穩定一致、只想人看沒把握的第 4 階
1丟一批照片+貼指令最快·一次性⏱ 5分鐘新手從這開始

最快的方式,就是把照片丟給一個看得懂圖的 AI,貼一段「分類+標信心」的指令。完全沒用過 AI?先點開下面這個,照做一次就會了:

+ 照著做:第一次打開 ChatGPT/Claude 看圖(照做一次,之後就會了)
  1. 打開瀏覽器(Chrome/Edge 都行),在網址列手動輸入 chatgpt.com(或 Claude 打 claude.ai)再按 Enter。不要用 Google 搜尋點進去,免得點到假網站。
  2. 第一次會要你登入:按「Sign up/註冊」,選「用 Google 帳號繼續」,跟著畫面按就好,不用記新密碼。
  3. 進去後,中間下方那條長長的輸入框就是「對話框」;要傳照片,按輸入框最左邊的迴紋針/+,選你要的圖。ChatGPT 和 Claude 都看得懂圖。
  4. 要錢嗎? 看圖這件事免費版就能做,先不用付錢。但有一個很現實的張數/用量上限,下面第 5 點會講。

你能在對話框左邊看到迴紋針/+、按下去能選到照片,就準備好了。

  1. 開一個新對話,按輸入框最左邊的迴紋針/+,一次選一小批照片(先別把整個資料夾幾百張全丟)。
  2. 等它上傳好:每張圖上方會冒出小縮圖、先轉圈圈,等它不轉、縮圖出來才算成功,再往下。
  3. 貼下面這段「分類+標信心」指令,按 Enter 送出。
  4. 看它回的:有沒有分成你要的類別、每張標了高/中/低、把低信心的另外列一份——這三樣齊了才算對。(如果它直接下「這批合格、那件報廢」的結論,回一句「不要下最終判斷,只分類+標信心」。)
  5. 這裡有個很現實的坑,先講白:免費版看圖有上限,而且兩家不一樣。ChatGPT 免費版一天大約只能傳 2~3 張圖(用完要等幾小時或隔天);Claude 免費版一次對話能塞的圖多一些(大約十幾二十張),所以「一批照片」這種需求,免費階段 Claude 通常比較合用。但別以為 Claude 就能一口氣跑完一整批——它除了「單次張數」,還有每幾小時一算的用量上限,圖片很吃額度,你一次丟十幾張、再來回追問幾輪,很可能還沒看完就被鎖住、要等冷卻。所以務實做法是分成小批、看完一批再下一批;真的要一次看幾十張、幾百張,那就是第 3、4 階(或升級付費版放寬額度)的事了。
你是影像初篩助手,幫我看這批照片,只做「初步分類」,不要下最終判斷。 分類標準:分成「正常」和「疑似有問題」兩類。以下才算「疑似」:刮痕、缺角、破損、印刷/標籤明顯歪斜或缺字;只是灰塵、反光、拍照角度或光線造成的,不算問題本身。 每一張都要做三件事:①標上檔名或順序;②歸類(正常/疑似);③標你的把握程度(高/中/低)。 最重要的一條:只要照片反光、太暗、拍糊、角度讓你看不清,或這是你沒把握判斷的品項,一律標「低」,寧可標低也不要硬給答案——這些我會請人再看。 最後把所有「低」把握的單獨整理成一份「待人複核清單」,並簡短說明每張為什麼沒把握(例:反光看不清左下角)。 不要幫我刪除或搬移任何照片。

傳公司照片前先想一下:品檢照、現場照、單據照,很可能是營業機密,或不小心拍到人臉、車牌、身分證這類個資。最保險是先把可辨識的部分遮掉(打碼、裁切),或先問公司是否允許把這類照片上傳到雲端 AI——有些公司規定不能,一定要遵守。真的很敏感、整批不能外傳的,走第 4 階「在自己電腦本機跑」的做法(那條要找技術同事幫忙設一次,見第 4 階)。

2存成專屬判讀助手重複用·不用每次重貼⏱ 15分鐘多數人停這就夠

每週、每個月都在看同一類照片?第 1 階最煩的是每次都要重貼那串指令、重講一次「什麼算瑕疵」。把它存成一個記得你判讀標準的專屬助手,下次點開、丟照片就好。

先講錢,兩家不一樣,別一起算Claude 這邊免費就能做——免費版就能開 Project(專案)(免費最多 5 個),把判讀標準放進去重複用,不必付錢;要更高用量、更多專案才升 Claude Pro(約 US$20/月)。ChatGPT 這邊要付費——自己做一個專屬 GPT 需要 ChatGPT Plus(約 US$20/月),免費版只能用別人做好的、不能自己建。所以想省錢又要「存成助手」:用 Claude、免費就能起步;真的偏好 ChatGPT 才需要為這一階付費。

  • 用 Claude(免費就能做):開一個 Project(專案),把第 1 階那段「分類標準+一定要標低信心」的規則,原封不動貼進專案的「自訂指令」。示範照片可以放進專案,但要知道它的用途——是給你(人)對照用的,不是拿去「教」AI 看圖(原因見下一則)。
  • 用 ChatGPT(需 Plus)Explore GPTs → + Create 開一個自訂 GPT,把同一段判讀標準貼進 Instructions

一個很多人會誤會的地方:自訂 GPT/Claude 專案的「知識庫(Knowledge)」,是拿來翻查文件文字用的,不會把你上傳的幾張「良品/瑕疵示範圖」拿去跟新照片逐張比對。所以你不能期待「丟幾張範例圖進知識庫=教會它看你的標準」——它判讀新照片時根本不會回頭比對那些圖。真正能用「圖片」教視覺標準的,是第 4 階的訓練專屬模型(Teachable Machine)。在第 1、2 階,你要把標準寫成文字(例:「刮痕=線狀、露出底色;缺角=邊緣缺一塊」),這才是讓 AI 真正照著判的方式。

這裡藏了整篇最重要的一件事:你在第 1 階寫的那段「分類標準+一定要標低信心」的文字規則,原封不動就能貼進這裡當助手指令——之後第 3 階接資料夾、第 4 階訓練模型,靠的還是同一套標準。標準只寫一次(用文字),跟著你一路往上爬。

夠用了就停在這——多數人到第 2 階就解決問題了。下面 第 3 階第 4 階是「想更自動、想一勞永逸」再看,點卡片標題就能展開

3接雲端相簿/資料夾批次跑照片放著·少搬檔進階·之後再看

當照片本來就固定存在某個雲端資料夾(Google Drive、Google 相簿),你會懶得每次手動一張張上傳。這一階是讓 AI 直接去那個資料夾讀——好消息是現在這一階不必開終端機、不用寫程式,但兩家門檻差很多:

  • Claude 的 Connector(免費也能用):Claude 內建的 Google Drive 連接器,用一次 Google 登入(OAuth)就能授權它讀你的雲端硬碟,路徑在 設定 → Connectors 找 Google Drive 授權。這是對免費使用者較友善的一條路(付費只是給更高流量)。
  • ChatGPT 的 Connector(要付費,且有地區限制):ChatGPT 的連接器只有付費方案(Plus 及以上)才有,免費版在設定裡根本找不到、照做會撲空;而且它在歐盟/英國/瑞士不提供。若你用免費 ChatGPT、或人在那些地區,這條走不通,請改用下面「下載成一包再分批上傳」的方式。(付費 ChatGPT 的授權要走 設定 → 連接器(Connectors) 登入 Google,連好後才在對話框 引用資料夾裡的檔——直接在 裡多半找不到完整授權流程。)
  • 授權前後都要顧安全授權前先看清楚同意畫面列出的權限——多數官方連接器是唯讀,但別直接假設「一定只是讀」;而且它看得到整個 Drive,建議另開一個「給 AI 讀的專用照片資料夾」只放要判讀的照片。要收回授權:到 Google 帳號 → 安全性 → 找「你與第三方應用程式和服務的連結」→ 點該 App → 移除存取權(Google 偶爾會調整這頁名稱,認「第三方連結」這幾個字就對)。
  • 私人相簿/資料夾「貼連結」多半沒用:把 Google 相簿或 Drive 資料夾設成「知道連結可檢視」再把網址貼給 AI,它常常還是讀不到裡面每一張圖。要嘛用上面的 Connector 授權,要嘛把那批照片下載成一包再分批上傳。別以為貼個連結它就全看到了。
  • Google 相簿內建「Ask Photos」(Gemini,零程式):Google 相簿現在能用一句話問「找出所有拍到破損包裝的照片」這類用內容找圖的搜尋。但要認清它的定位——它擅長「幫你把某類照片找出來」,不是幫你逐張下「合格/不合格」判讀。把它當「先幫我把可疑的那些撈出來」的粗篩很好用,撈出來之後還是回到「標信心、人複核」那套。
+ 什麼是Connector(連接器)?

Connector=AI 官方內建的「一鍵授權接口」。你用 Google 帳號登入、同意一次,AI 就能讀你指定的雲端檔案,不用像以前那樣手動設定或寫程式。這是這兩年才成熟、對不會寫程式的人最重要的一條接資料的路。

這一階的但書,比別篇更要強調:把照片交給 AI 批次跑,很快、但它照樣會看走眼——量一大,你更不可能每張都盯。所以「標信心+人複核低信心」這套護欄,在這一階只會更重要,不能因為自動化就拿掉。不確定怎麼設,先請懂一點工具的同事陪你接一次 Connector,你不必自己啃技術文件。

4訓練專屬模型·半自動流程天天大量·只把沒把握的送人進階·想一勞永逸再看

如果你天天都在看同一種照片(例如產線上同一款產品的瑕疵、同一種單據),最治本的不是每天丟給通用 AI 猜——而是用你自己的照片訓練一個「只認得你這一類東西」的專屬模型,讓它給出穩定一致的判讀,然後把整套接成一條半自動流水線:高信心的自動歸檔,只把「沒把握的」送人複核。

別被嚇到:這一階的核心觀念只有一句——「AI 自動篩、人只看它沒把握的那一小疊」。下面的訓練工具、本機模型都是「想更進階再點開」的選配,先讀完觀念就好。

+ 為什麼要「專屬模型」,不繼續用通用 AI 就好?

通用 AI(ChatGPT/Claude)什麼都能看,但正因為「什麼都能看」,它對你這一款特定產品的標準沒有概念,同一張圖今天問明天問可能給不一樣的答案。專屬模型是你拿「幾十張正常、幾十張有瑕疵」的自家照片去「教」出來的——它只認你這一類東西,判讀比較穩定、信心分數比較可信,也才適合天天大量跑。

先給結論:新手要試「訓練專屬模型」,最沒門檻的是 Google 免費的 Teachable Machine——全程在瀏覽器裡、不用寫程式、不用灌軟體

+ 照著做:用 Teachable Machine 訓練一個「正常/瑕疵」分類器(免費·零程式)
  1. 瀏覽器打開 teachablemachine.withgoogle.com,選 Get Started → Image Project → Standard image model
  2. 建兩個類別(Class):一個叫「正常」、一個叫「瑕疵」(要更細可再多開幾類)。
  3. 每一類餵它照片:把你手上已經確定分好類的照片,一類拖幾十張進去(越多越準,但先幾十張就能看效果)。
  4. Train Model(在你自己電腦上跑,幾分鐘)。訓練完,右邊可以當場丟一張新照片測,它會給每一類一個百分比信心
  5. 這個信心百分比就是你半自動流程的關鍵:設一條線(例如「瑕疵信心 ≥ 90% 才自動歸到瑕疵、80~90% 一律送人複核」),把中間地帶的通通推給人看。
  6. 要接進程式自動跑,可以 Export Model——這一步開始才需要技術同事幫你接;但「訓練、抓出信心分數、決定門檻」你自己就做得到。

它的極限要知道:Teachable Machine 適合類別不多、當概念驗證用;真的要上產線大量、要很高準確度,就得換更專業的方案(見下)。

  • 要更專業、量更大:可以用雲端的專業影像辨識服務(例如 Google Cloud Vision、Azure 影像服務)或訓練專門模型——這些準、可大量,但要技術同事幫你接一次、也要算雲端費用,不是自己點一點就好,先評估值不值得。
  • 整批照片機密、一張都不能外傳?:有一條「在自己電腦本機跑、照片完全不上雲」的路——用本機開源視覺模型(例如以 Ollama 跑 LLaVA、Llama 視覺版這類),照片留在你機器裡、不外流。但這條有兩個門檻:一是要安裝、要碰一點設定;二是吃硬體——本機視覺模型需要一台有獨立顯卡、或記憶體較大的電腦才跑得順,一般辦公室文書機會非常慢甚至卡死。所以先確認機器夠力,再找懂技術的同事幫你設定一次,別自己在普通筆電上從零硬啃。

半自動流程的骨架,長這樣:

一批照片固定資料夾 AI 初篩分類·每張標信心 高信心→自動歸檔仍抽 5–10% 驗 低信心→待複核單獨一份清單 人認定合格/報廢拍板

⚠️ 金色那條(低信心 → 人認定)是絕對不能省的主幹。灰色虛線(高信心自動歸檔)也不是全自動放行——每一類都要有人固定抽 5~10% 回頭對原圖,抽到一張錯就代表門檻要調高。「半自動」的意思是機器幫你少看 90%,不是人完全不看。

把「一張張看到眼花」變成「機器先分堆、人只看那一小疊沒把握的」——省的是眼力,不是責任
+ 半自動流程 5 步 SOP(可貼牆上)

把「要有人顧」變成照著做的清單:

  1. 新照片放進「待判讀」資料夾(誰放:___)
  2. 跑模型/AI 初篩,每張出「類別+信心」
  3. 依門檻分兩堆:高信心自動歸檔、低信心進「待複核清單」
  4. 人看待複核清單,逐張認定;高信心那堆每類抽 5~10% 抽驗
  5. 抽驗發現放錯 → 把門檻調高、或把那張加回訓練資料,讓模型下次更準

要走到這一階,先誠實面對這幾件事(不然撐不過第一個月):負責每天放照片、按重跑?低信心清單看、看不完怎麼辦?門檻訂多嚴(訂太鬆會漏、訂太嚴等於全部人工看)?機密照片長期進雲端能看、公司准不准?出了漏網之魚扛?這些答得出來,再建。

護欄:其實大多數人停在第 1 或第 2 階就夠了。只有「天天大量、同一種照片、要穩定一致」才值得爬到第 4 階去訓練專屬模型——偶爾看一批照片還去訓練模型,是拿大砲打小鳥,投報率是負的。

你可以帶走的

用 AI 判讀影像,成敗不在它看得多準,在你有沒有把它擺在「初篩」這個位置,還有你想走多遠

  1. 每一次都:AI 只做初篩、不下最終判斷,逼它標信心、把沒把握的單獨列出來,人力集中看低信心那批,高信心也抽驗
  2. 標準只寫一次(用文字)——第 1 階那段「什麼算瑕疵+一定要標低信心」,能一路帶到專屬助手、接資料夾、訓練模型(別指望丟幾張範例圖就能教會它看)
  3. 想快就停第 1 階(免費,Claude 一次能傳的圖較多,記得分小批);每週都要看就上第 2 階存成判讀助手(Claude 免費就能開 Project,多數人到這就夠)
  4. 天天大量、要穩定,才往第 4 階訓練專屬模型做半自動流程——但記得,它是一套要有人顧的紀律(那條門檻、那份低信心清單、那個抽驗),不是一個按下去就沒事的按鈕

不會寫程式沒關係——把 AI 當第一道篩子,最後一眼留給人,你就又快又安心。


Ridgeline · by Lucas

← 回解題筆記庫回稜線首頁 →