AI Product Strategy

不是模型越強越好:AI 拍照辨識裡的產品取捨

Product Trade-offs in AI Photo Recognition

AI Product Strategy · by Leann Chen · June 25, 2026

⚠️ 這篇不是在比較哪個 AI 模型辨識更準,而是想回顧一個看似簡單的「拍照辨識」功能,真正進入產品後,我遇到的幾個取捨:辨識準確率、等待時間、AI 成本、資料累積,以及辨識失敗後,產品要怎麼繼續承接。

⚠️ 這也不是一套可以直接套用到所有 AI 拍照辨識產品的標準流程,而是我從實際工作經驗整理出來的一些觀察。不同產品、資料來源與使用情境,都會影響流程的設計,因此真正落地時,還是需要持續測試、驗證與微調,才能找到比較適合當下產品的做法。


隨著 AI 越來越強,許多功能在規劃時,很容易讓人有一種錯覺:「直接丟給大模型就能解了。」尤其是拍照辨識這類功能,看起來更像是大模型就可以做到的。
用戶拍一張照片,AI 看圖,然後回答「這是什麼產品」。流程聽起來很合理,也很符合一般人對 AI 功能的想像。
但真正把這類功能放進產品裡,問題通常不只在於模型能不能看懂圖片。更麻煩的是後面這些問題:

  • - 辨識要多準?
  • - 每一次辨識的成本能不能接受?
  • - 用戶願意等多久?
  • - 哪些技術雖然更準,卻不一定最後放進流程?
  • - AI 不確定時,要不要讓用戶補救?
  • - 這次拍照產生的資料,能不能成為下一次不用再辨識的基礎?

看起來只是「拍照辨識」,實際上可能牽涉到多模態辨識(Multimodal Recognition)、光學字元辨識(OCR)、搜尋補資料、資料庫比對與大型語言模型(LLM)的整理與判斷。LLM 只是其中一層,不是全部。

因此在拆這類問題時,不要直接把辨識結果好不好直接歸到模型,而是分開看:用戶真正想完成什麼、圖片到結果之間其實包含哪些不同任務、每個環節需要什麼能力、哪些資料可以被保存與重新利用,以及辨識不完整時,產品要怎麼承接。
以下會以「消費品包裝辨識」這類情境,整理並回顧我在過往經歷中遇到的經驗。

模型越強,就越適合把事情全部交給它嗎?

拍照辨識這類功能,一開始很容易讓人直覺認為:「既然現在的大模型已經可以看圖、讀文字、整理資訊,那是不是直接把圖片交給更聰明的模型就好了?」
可是當這件事要被放進正式產品流程裡時,問題就不只是模型夠不夠聰明,夠不夠強。

每一次辨識要花多少成本、用戶要等多久,以及最後回來的答案能不能被產品穩定使用,都需要一起考慮。

如果只是依賴大模型本身已經學過的知識,會先遇到一個問題,那就是:「消費品更新速度太快了!」
市場上幾乎每天都可能有新產品、新包裝、新版本出現,但一個已經訓練好的模型,不可能同步知道所有最新商品。遇到剛推出、剛改版、比較冷門,或只在某些地區販售的產品時,就很可能認不出來,或只能給出不完整的判斷。

而且能力更強的模型,往往也需要一起評估推理成本與回應時間。所以問題不只是「它能不能回答」,而是這樣的成本與速度,適不適合放在一個會被反覆使用的產品流程裡。

那如果改成串有搜尋能力的大模型呢?

這確實可以補上「模型本身不知道最新產品」的問題,但搜尋能力不代表答案一定正確。因為搜尋解決的是「找得到相關資料」,卻不代表找到的資料就是圖片裡的那一個產品。搜尋回來的可能是相似產品、同品牌其他系列、舊包裝,或不同地區版本,最後仍然可能得到一個看起來合理、實際上卻不正確的答案。

對用戶來說,他只是拍了一個產品;但對產品來說,還需要同時考慮這個結果是不是可靠,以及為了得到這個結果,需要付出多少等待時間與推理成本。

因此,把能力更強、能做更多事情的模型放進來,不代表用戶的整體產品體驗就一定會更好。這時候真正要判斷的已經不是「哪個模型最強」,而是:

這套做法的準確度、速度與成本,是否適合被放進一個會長期、反覆使用的產品裡?

看起來只是一個 AI 辨識功能,但不代表工作流程中只有一個任務

核心:任務拆解 Task Decomposition

問題可能不只是模型夠不夠強,而是我們一開始就把「產品辨識」想得太單純了。

對用戶端來說,這個功能確實很簡單:拍一張照片,然後知道這是什麼產品。
但對產品端來說,要讓用戶最後真的得到一個可以使用的結果,中間其實不只是在做一件事。除了辨識圖片裡的產品,還要考慮既有資料能不能被利用、結果不夠確定時要怎麼處理,以及 AI 最後真的無法完成辨識時,用戶還能不能繼續完成原本的任務。

這時候需要進行任務拆解(Task Decomposition)。所以我會先把整個產品流程攤開來看,再進一步拆解其中真正需要處理的不同任務。

對用戶來說,可能只是:
拍照 → 得到產品辨識結果
但考慮到需要真正產品化之後,可能變成這樣:
拍照
→ 圖片裡有哪些可以使用的線索
→ 搜尋並取得可能的產品做為候選
→ 候選產品比對與身分判斷
→ 產生基本辨識結果
→ 結果不確定時,是否需要額外驗證
→ 辨識不完整時,用戶還能怎麼完成任務(替代流程)
→ 哪些結果值得被保存,成為之後可以再次利用的資料

圖片裡有哪些可以使用的線索
這一層不是單純只讀文字,也不是只看外觀,而是先把圖片裡可以利用的資訊整理出來。這裡會用到模型的多模態能力,同時分析圖片中的文字與視覺資訊。
例如品牌名、產品名、包裝形狀、顏色與版面特徵等。包裝上如果有品牌名、產品名或其他可讀文字,就可以成為判斷線索;如果文字不完整,或拍攝角度讓文字不清楚,也還可以從包裝形狀、顏色、輪廓與瓶身特徵等視覺資訊去縮小可能範圍。

例如牙膏這類產品,通常會有比較明顯的軟管外型與包裝比例,和一般瓶罐類產品不太一樣。這些線索未必足以直接判斷出它是哪一款牙膏,但至少可以先幫助縮小可能範圍。接著,才可以利用這些線索去找可能的產品,形成下一步的候選集合。

搜尋並取得可能的產品做為候選
這裡指的是用前一步得到的線索,搜尋出可能的產品,形成候選集合。
因為搜尋到產品,不代表已經完成辨識。搜尋回來的結果可能有 A、B、C 幾個相似產品,也可能混進同品牌其他系列、不同容量、舊包裝或不同地區版本。

這些結果只能先當成候選,不能因為搜到了,就直接把其中一個當成正確答案。後面還需要再回頭比對原始圖片與候選資料。

候選產品比對與身分判斷
這步驟是比對候選產品與原圖,判斷產品身分。因為這時候要看的就不只是搜尋結果,而是候選產品的名稱、包裝文字、外觀特徵、規格等資訊,能不能和原始圖片裡看到的線索對得上。例如:

哪一個候選和原圖最符合?
包裝上的文字、外觀與產品資訊能不能對得上?
如果沒有一個候選真的符合,是不是應該保留「無法確認」,而不是硬選一個答案?

這裡還有消費品辨識中很重要的一點,就是不能因為搜尋結果裡有幾個很像的產品,就一定要選一個最接近的答案。因為不同容量、不同國家版本、不同包裝語言,也可能同一系列底下有好幾個很像的品項,只要產品身分判斷錯了,後面保存下來的資料也可能跟著不準。

這三個步驟看起來都在完成同一件「產品辨識」,但其實每一次看的問題都不一樣。
有點像人在判斷一個不熟悉的產品時,第一次看一個產品時可能先注意「它是什麼」,第二次再仔細檢查包裝文字與其他資訊是不是對得上,最後再回頭判斷整體結果是否合理。每一次看的目的不同,不是單純把同一個問題重問好幾遍,而是用不同問題去確認前面的答案。

任務拆解的重點不是把流程拆得越細越好,而是讓不同性質的問題有各自比較適合的處理方式,也讓流程或結果出了問題之後,我們知道應該先從哪一段開始查。

這也是任務拆解很有價值的地方,因為流程被拆開之後,另一個好處是錯誤比較容易定位。如果最後結果不對,就可以進一步去看:是圖片裡的線索一開始就判讀錯了?還是搜尋階段根本沒有找到正確產品?又或者正確產品其實已經出現在候選裡,但最後比對時選錯了?

不同原因,調整方向也不同。圖片線索有問題,就回頭看前面的圖片理解;搜尋不到正確產品,就看搜尋條件或資料來源;如果正確產品已經在候選裡,卻在最後判斷錯,就要檢查後面的比對邏輯。

「圖片裡有哪些可以使用的線索 → 搜尋並取得可能的產品做為候選 → 候選產品比對與身分判斷」比較接近產品辨識本身的核心任務拆解;而資料重用、額外驗證與替代流程,則是把這項辨識能力真正放進產品之後,為了處理效率、成本、不確定性與失敗情境而需要另外考慮的流程。


結果不確定時,是否需要額外驗證?但準確率更高,就一定值得放進主流程嗎?

核心:信心度查證 Confidence Verification

當基本辨識結果產生之後,還會遇到另一個問題:「這個答案到底可不可信?」

因為前面的產品辨識流程即使已經給出答案,也不代表最後得到的結果就一定完全正確。這時候可以再多做一層「信心度查證」。

這裡說的信心度,不只是單純替答案打上一個高或低的標籤,而是再回頭檢查前面得到的結果到底合不合理:產品身分是不是對得上原圖、包裝上的文字與搜尋資料是否一致,以及目前掌握的資訊有多大程度值得相信。

信心度查證更像是在重新看:「前面得到的這個答案有多可信?」它的思路是把前面的辨識結果,再交給另一輪 AI 判斷重新檢查,從不同的判斷目的去確認結果本身的合理性與正確性。

這類做法有機會讓辨識結果更穩,但真正產品化之後,問題很快就會變成:「為了讓答案更可信,多出的這一層查證到底值不值得?」因為每增加一次 AI 判斷,系統要多做一次處理,而這些最後都會反映在用戶等待時間與公司的運算成本上。所以這時候,問題就不是單純追求最高準確率,而是要一起衡量:

辨識品質能提高多少?
用戶要多等多久?
每一次請求會增加多少成本?
如果判斷錯誤,後續影響又有多大?

不同產品對這幾件事的容忍程度也不一樣。
如果是在醫療、金融或法律這類錯誤代價很高的情境,多一層甚至多幾層查證可能合理,因為更高的準確性本身就具有很高的價值。

但在需要快速完成操作的產品流程裡,情況就不太一樣。用戶看不到系統背後多做了幾輪判斷,他更直接感受到的可能只是:「為什麼這次要等這麼久?」、「功能是不是有問題?」

所以對我來說,信心度查證真正帶來的產品問題,不只是「能不能讓結果更準」,而是多出來的可靠性,值不值得交換更長的等待時間與更高的推理成本。

技術上可以做到更準,不代表就一定值得全做進產品裡。

而且就算增加額外驗證也不代表每一次識別結果都需要走完全相同的額外驗證流程。例如,如果某些結果本身已經有足夠資訊支持,而另一些結果明顯存在較高的不確定性,那就可針對不同情況採取不同程度的驗證,也會是一個可以評估的方向。


當 AI 辨識失敗,用戶還能不能往下走?

核心:替代流程 Fallback Flow & 人類介入 Human-in-the-loop

當前面已經考慮過任務拆解、以及不同信心程度要不要追加驗證之後,最後還可能會遇到一個沒辦法完全避免的情況:「AI 就是辨識不出來!」

可能是產品太新、照片角度不好、包裝文字不完整,也可能是搜尋到的候選都太接近,最後還是沒有足夠資訊可以確認。這時候,如果產品流程只設計到「AI 成功辨識」為止,用戶就會卡住。

考慮到當 AI 沒有完成辨識時,用戶還有沒有其他方式把這件事做完?這時候就需要替主流程準備一條甚至多條替代流程(Fallback Flow)。

替代流程的目的不是在 AI 失敗之後,再做一套更複雜的完整辨識,也不是一直要求模型繼續猜,直到產生一個看起來像答案的結果。它真正要處理的是:

當自動辨識沒有完成時,怎麼讓用戶還是有辦法把原本的任務做完?

AI 沒有辦法完整判斷產品時,有些步驟也可以把判斷權交回給用戶。讓人類介入(Human-in-the-loop),例如包裝上其實還有可利用的資訊,這時可以讓用戶補拍局部細節,再透過 OCR 讀取產品名稱、標籤文字或其他關鍵資訊;如果系統已經找到幾個可能的候選,也可以讓用戶直接確認,或手動補上必要欄位,讓他仍然能完成保存。

包裝上仍有可用文字 → 用戶補拍局部細節 → OCR 讀取關鍵資訊。
已有候選 → 用戶確認。
資訊仍不足 → 用戶手動補欄位。

這幾條路徑解決的是不同的資訊缺口,但目的其實一樣:不要讓 AI 的辨識失敗,直接變成用戶流程的終點。

它不代表 AI 做得不夠好,而是承認在目前的 AI 能力下,有些判斷本來就更適合由人類確認。因為產品要設計的不是「如何讓 AI 永遠不要失敗」,而是「AI 做得到的部分交給 AI;當資訊不足或判斷風險太高時,可以再讓用戶接手最適合由人處理的部分。」

這樣看起來好像沒有那麼「自動化」,但對產品來說反而更重要。因為如果為了追求完全自動化,最後讓用戶卡在一個沒有出口的步驟,那 AI 本身就算再強,也沒有真正把功能做好。

AI 辨識成功,不應該是這個功能唯一的成功條件;用戶最後有沒有把事情完成,才是更重要的。

OCR 讀得到文字,不代表它認得產品

核心:光學字元辨識 OCR

前面提到,當 AI 沒有辦法完整辨識產品時,其中一種替代方式,是讓用戶補拍包裝上的局部細節,再透過 OCR 把文字資訊讀出來。

例如原本的照片只拍到部分包裝,產品名稱不完整,這時候可以再請用戶補拍標籤、瓶身文字或其他比較清楚的位置,把原本缺少的資訊補回來。

但實際在拆這類功能時,我覺得有一個認知很重要:

OCR 解決的是「讀字」,它能把文字讀出來,不代表已經完成了產品辨識。

它可能讀出品牌名稱、產品名稱、容量、系列文字或包裝上的其他資訊,這些都可以成為後續判斷產品身分的重要線索。但「讀到文字」和「知道這到底是哪一個產品」還是兩個不同的問題。

因為消費品本身常常存在很多很接近的版本。例如同一個品牌底下可能有相似系列、不同容量、不同地區版本、不同語言包裝,也可能經歷過包裝改版。有時候兩個產品的大部分文字甚至都一樣,只差其中一個規格、系列名稱或包裝細節。

OCR 可能已經讀到某個品牌名稱和部分產品名稱,但接下來還是要再看:
- 包裝形狀是不是一致?
- 顏色、版面與圖像特徵能不能對上?
- 容量或規格有沒有差異?
- 是不是同一系列底下另一個很像的品項?
- 有沒有可能只是舊版或其他地區版本?

所以在這類產品辨識裡,我比較不會把 OCR 當成「辨識產品的答案」,而是把它看成其中一種取得線索的能力。

這很重要,不只是某項技術「能不能做到」,而是它在整個辨識流程裡最適合解決哪一個問題。能力邊界釐清之後,才能把不同技術放在比較適合的位置。


每一次的產品識別,真的都要重新跑 AI 嗎?

核心:資料重用 Data Reuse & 資料品質 Data Quality

當產品開始被長期、反覆使用之後,我又開始思考另一個問題:「同一個產品如果之前已經辨識過,下一次再有人拍到它時,真的還需要重新跑一次完整的 AI 辨識嗎?」

每一次得到的資料,有沒有機會反覆運用?有沒有可能成為下一次更快完成辨識的基礎?

消費品和一些一次性的圖片辨識情境不太一樣。同一個產品很可能被不同用戶反覆拍到。如果每一次都重新進入 AI 辨識、搜尋與判斷,不只每個用戶都要重新等待,同一件事情也會不斷產生新的推理成本。所以在規劃功能時,我也會把資料庫比對與資料重用一起放進考量。

拍照
→ 先查看既有資料中是否已經有可以使用的產品結果
→ 如果能夠命中足夠可信的既有資料,就直接利用已有結果
→ 如果沒有找到、資料不足,或仍然無法確認,再進入 AI 辨識

這代表資料庫不只是 AI 辨識完成之後,把資料存起來的地方;它也可以反過來參與下一次辨識流程。例如,同一個產品前面已經被辨識並留下完整資料,下一個用戶又拍到同一款產品,如果現有資料已經足以支持判斷,就不一定需要把後面的圖片理解、搜尋候選與 AI 判斷全部重新跑一次。

但這個設計也馬上帶出另一個更重要的問題,就是「什麼樣的資料,才有資格被下一次直接拿來用?」

如果第一次辨識結果就是錯的,卻因為被保存進資料庫,之後每次命中都直接使用,那原本只發生一次的 AI 誤判,就可能變成被重複利用的錯誤。

這時候就需要去思考:
- 哪些辨識結果可以成為後續比對依據?
- 哪些結果還有太多不確定性,不適合直接重用?
- 哪些資訊需要經過進一步確認後才適合留下?
- 如果之後發現資料有誤,有沒有辦法修正或淘汰?

所以資料重用不只是「怎麼少跑幾次 AI、節省 Token」的問題,同時也是一個 Data Quality 的問題。

模型和流程,都不是一次性決定的,而是要持續調整

經歷過前面這些過程後,我覺得「AI 拍照辨識」功能真正難的地方,不是找到一個「最強的模型」,而是怎麼把 AI 能力真正放進一條可以長期使用的產品流程裡。

與前期測試可以先驗證不同產品、語言、地區版本與特殊情況,但真正上線之後,才會開始累積更多實際使用資料,也比較能看出前面的假設哪些成立、哪些地方還需要調整,以及問題實際發生在哪裡。

有些問題可能不是模型不夠強,而是圖片本身沒有足夠線索;有些則可能發生在搜尋候選、後面的身分判斷,或既有資料品質上。也有些做法在測試階段看起來效果很好,但真的放進產品後,才發現等待時間、成本或操作體驗並不適合長期使用。

所以我不會預設一開始就能設計出一個「永遠正確」的流程,而是先把每一段為什麼存在、要解決什麼問題想清楚。這樣等到產品真的開始累積資料後,才知道應該從哪一段回頭調整。

拍照辨識表面上可能只是一個「拍照 → AI → 得到答案」的功能,但真的產品化之後,背後其實還會牽涉到模型能力、搜尋、驗證、替代流程、資料重用,以及這些做法對等待時間與成本的影響。

這也是為什麼 AI 功能上線,不代表前面設計的辨識流程就已經定案。上線後累積的辨識結果、回應時間、成本與錯誤紀錄,都會成為下一輪優化與調整的依據。

模型能力決定了 AI 能做到什麼,但產品流程決定了這個能力能不能被穩定地用在產品裡。
Previous Story ← 🍵 我打造了漢方茶品牌,即將邁入第五年 Next Story AI 結果不穩,不一定是模型問題:Camera-based AIoT 裡容易被忽略的輸入問題 →