在病理診斷中,蘇木精-伊紅(H&E)染色是觀察組織形態的常用方法。蘇木精將細胞核染成藍紫色,伊紅則將細胞質和細胞外基質染成粉紅色。病理醫生通過顯微鏡觀察這些染色切片,來判斷細胞是否發生癌變。而在確定癌癥類型的過程中,準確識別癌癥細胞質區域是一個關鍵環節。
近年來,高光譜成像技術逐漸進入病理學研究的視野。與常規的CMOS相機相比,高光譜相機能夠獲取更豐富的細胞信息。但這項技術在實際應用中面臨兩個現實問題。
**個問題是數據獲取困難。 高光譜圖像的采集成本較高,建立大規模的標注數據集并不容易。而深度學習模型恰恰需要大量數據才能有效工作。第二個問題是儀器噪聲。 基于線推掃方式的高光譜相機在成像過程中,常常會產生垂直或水平的條紋噪聲、像素偏移等問題。這些噪聲因設備特性和使用環境而異,難以完全避免。
針對這些問題,在《Informatics in Medicine Unlocked》期刊上發表了一項研究。他們提出了一種數據增強方法,利用CMOS圖像生成模擬真實儀器噪聲的偽高光譜圖像,用于訓練U-Net分割模型。

1. 為什么用CMOS圖像來做增強?
一個直接的考慮是標注成本。高光譜圖像中的癌癥細胞質紋理復雜,在灰度圖像中手動標注既耗時又費力。相比之下,CMOS圖像視覺清晰,標注效率高得多。研究團隊的思路是:用容易標注的CMOS圖像生成帶有噪聲的偽高光譜圖像,再用這些圖像來訓練模型。

**步,色彩轉換與亮度調整。 將CMOS RGB圖像轉換為灰度圖,通過伽馬校正和直方圖均衡化調整亮度,使其接近高光譜圖像在特定波段(如580 nm)的視覺效果。
第二步,添加儀器噪聲。 在圖像中隨機加入垂直和水平的噪聲線,模擬實際高光譜相機中因傳感器靈敏度差異或信號處理產生的條紋噪聲。垂直噪聲線的數量在19到29條之間,水平噪聲線的位置和寬度也做了隨機化處理。此外還模擬了信息丟失和像素偏移。

第三步,幾何變換。 對生成的偽圖像進行裁剪、翻轉、平移等操作,進一步擴充數據集。
通過這套流程,44張原始CMOS圖像生成了792張偽高光譜圖像,與44張原始高光譜圖像合并后,訓練集達到836張。

2. 實驗效果如何?
研究團隊用5折交叉驗證評估了模型性能,采用的指標是IoU(交并比)和Dice系數。
僅用44張原始高光譜圖像訓練時,IoU為0.5786,Dice系數為0.7304。加入偽高光譜圖像后,IoU提升到0.6458,Dice系數提升到0.7820——IoU提高了約11.6%,Dice系數提高了約7.1%。

研究還發現,圖像亮度和細胞密度會影響分割效果。較暗的圖像類型和細胞核密集的圖像類型,分割準確率相對較低。這說明模型對圖像質量有一定依賴,也提示了未來改進的方向。
3. 這項研究的意義在哪里?
對于高光譜病理圖像的處理來說,數據稀缺和儀器噪聲是兩個繞不開的障礙。這項研究提供了一個可操作的思路:與其費力去噪,不如在訓練階段就讓模型學會應對噪聲。通過CMOS圖像生成帶有儀器噪聲的偽高光譜圖像,既解決了標注困難的問題,也增強了模型對噪聲的魯棒性。
當然,這項研究也有局限。實驗數據來自犬類乳腺腫瘤樣本,且圖像類型只有七種。更復雜的樣本類型和更大的數據集,還需要逐步積累。
但從方法層面看,這種“用易標注圖像生成帶噪聲訓練樣本”的思路,對于高光譜顯微成像在病理診斷中的應用,提供了一個值得參考的實踐路徑。隨著高光譜成像設備在病理科的逐步普及,類似的數據增強方法或許能幫助研究人員更高效地訓練模型,減少對大規模人工標注的依賴。
免責聲明
本內容為公開學術(文獻鏈接:https://www.sciencedirect.com/science/article/pii/S2352914826000213) 整理編撰,僅用于行業技術探討與科普學習,不作任何商業相關承諾,亦不能作為投資參考依據。文中所列各項實驗數據與結論會受試驗環境、樣本個體區別、模型構建方案等多重變量干擾,若落地實際場景使用,相關效果需結合自身場景另行實測核驗。