成大資工系高宏宇助理教授與學生 在國際競賽大放異彩 第三屆BioCreative國際分子生物文獻探勘競賽中 奪得第一名
【台南訊】國立成功大學資訊工程系暨醫學資訊所高宏宇助理教授與其指導的博士班學生魏至軒以「模糊感知推論網絡模型(AINet)」,在2010年9月美國馬里蘭州美國國家健康研究院 (NIH)所在地貝賽斯達(Bethesda)市舉行的「第三屆生物文獻自動探勘競賽(Critical Assessment of Information Extraction systems in Biology,簡稱Biocreative)」,大放異彩,在眾多國際著名文獻探勘機構所組織的中勝出,奪得第一名。難能可貴的是他們在9項評比中囊括五項第一,是所有勁旅表現最優的團隊,來自台灣成大助理教授高宏宇與其指導的博士班學生魏至軒有如此優異表現,確實在國際生物文獻探勘領域引起高度矚目與熱烈討論。
Biocreative是一個在生物文獻探勘領域中極具盛名的比賽,由西班牙國家生物資訊學會(Spanish National Bioinformatics Institute) Alfonso Valencia博士所帶領的國家腫瘤研發中心(CNIO, Centro Nacional de Investigaciones Oncologicas)於2003年開始比賽,比賽中包含了各種當今生物文獻探勘領域中的最重要問題,得獎隊伍的比賽結果與方法也都會受邀在重要的期刊上發表(上一屆比賽結果刊登於2010 Nature Biotechnology期刊)。
高宏宇助理教授與其指導的博士班學生魏至軒此次係參與「第三屆生物文獻自動探勘競賽」的「基因正規化的問題」項目。他們得獎的「模糊感知推論網絡模型(AINet) 」,係以推論網路結合機率統計的方法,開發出一個不需要訓練資料的擷取探勘系統,是眾多參賽者中唯一採用「非機器學習方法」的隊伍,他們在訊息微弱的文獻中,透過一個創新的統計推論方式將微弱的基因鑑別證據放大,並用於擷取出文章中正確的基因號碼,這是一個推論模型在生物資訊議題上的一個既新奇又有效的應用。
以目前大型生物知識庫仍得仰賴大量專家人力從文獻中擷取知識,其建置成本相當龐大。高宏宇助理教授的模糊感知推論網絡模型技術對建立生物知識庫而言的確是不可或缺的。未來將以發展出一個全面性、可用性、穩定性的基因號碼自動擷取的系統並推廣讓各國生物學家使用為目標。
據了解,該競賽之評比規則,是採用美國國家生物科技資訊中心(NCBI)在今年所發展的門檻值平均精確度分數(TAP-K, Threshold Average Precision-K)來進行評估,評估資料共507篇文獻,其中又將最難擷取的50篇文獻,另列2組評比組別,總共3個組別,每組別中設定了3個不同的K值進行評比(K=5、K=10、K=20),全部有9項評比。而高宏宇助理教授與其指導的博士班學生魏至軒兩人表現特別優異,在「基因正規化的問題」項目的九項評比中,取得五項第一,拿下總成績第一名,殊屬不易。
Biocreative競賽的評比項目,是由大量的生物醫學論文中,以電腦系統自動擷取文獻中的「基因號碼」。這個比賽項目被視近年來生物文獻探勘領域中最難的問題之一。文獻探勘主要的目的在於自動、有效、正確的找出生物學者感興趣的「交互作用關係」,在要找出這些關係之前,如何找出對應到基因資料庫內的基因號碼與基因名稱正規化是相當重要的議題。
基因正規化的問題是將生物文獻中所提到的基因標註後,進一步轉成標準的基因資料庫編號。其挑戰性在於基因別名太多,缺乏完整的命名詞典,且有很多不同物種間共有的基因名稱相同但基因編號不同的混淆情況,因此需要確認文獻提到的基因是指何物種的基因。
「第三屆生物文獻自動探勘競賽」參賽勁旅相當多,成功大學之外,還有中央研究院、元智大學、美國國家生物科技資訊中心(NCBI)、美國亞利桑那州立大學(GNAT系統開發團隊)、美國威斯康辛大學密爾沃基分校、美國愛荷華大學、科羅拉多大學丹佛分校、大陸清華大學、蘇黎世大學、葡萄牙阿威羅大學、日本東京大學等世界名校的研究團隊。其中,有許多著名文獻探勘系統,如:GENIA、GNAT、Linnaeus、AIIA-GMT、BIOSMILE、BioThesaurus等團隊。
Biocreative是一個在生物文獻探勘領域中極具盛名的比賽,由西班牙國家生物資訊學會(Spanish National Bioinformatics Institute) Alfonso Valencia博士所帶領的國家腫瘤研發中心(CNIO, Centro Nacional de Investigaciones Oncologicas)於2003年開始比賽,比賽中包含了各種當今生物文獻探勘領域中的最重要問題,得獎隊伍的比賽結果與方法也都會受邀在重要的期刊上發表(上一屆比賽結果刊登於2010 Nature Biotechnology期刊)。
高宏宇助理教授與其指導的博士班學生魏至軒此次係參與「第三屆生物文獻自動探勘競賽」的「基因正規化的問題」項目。他們得獎的「模糊感知推論網絡模型(AINet) 」,係以推論網路結合機率統計的方法,開發出一個不需要訓練資料的擷取探勘系統,是眾多參賽者中唯一採用「非機器學習方法」的隊伍,他們在訊息微弱的文獻中,透過一個創新的統計推論方式將微弱的基因鑑別證據放大,並用於擷取出文章中正確的基因號碼,這是一個推論模型在生物資訊議題上的一個既新奇又有效的應用。
以目前大型生物知識庫仍得仰賴大量專家人力從文獻中擷取知識,其建置成本相當龐大。高宏宇助理教授的模糊感知推論網絡模型技術對建立生物知識庫而言的確是不可或缺的。未來將以發展出一個全面性、可用性、穩定性的基因號碼自動擷取的系統並推廣讓各國生物學家使用為目標。
據了解,該競賽之評比規則,是採用美國國家生物科技資訊中心(NCBI)在今年所發展的門檻值平均精確度分數(TAP-K, Threshold Average Precision-K)來進行評估,評估資料共507篇文獻,其中又將最難擷取的50篇文獻,另列2組評比組別,總共3個組別,每組別中設定了3個不同的K值進行評比(K=5、K=10、K=20),全部有9項評比。而高宏宇助理教授與其指導的博士班學生魏至軒兩人表現特別優異,在「基因正規化的問題」項目的九項評比中,取得五項第一,拿下總成績第一名,殊屬不易。
Biocreative競賽的評比項目,是由大量的生物醫學論文中,以電腦系統自動擷取文獻中的「基因號碼」。這個比賽項目被視近年來生物文獻探勘領域中最難的問題之一。文獻探勘主要的目的在於自動、有效、正確的找出生物學者感興趣的「交互作用關係」,在要找出這些關係之前,如何找出對應到基因資料庫內的基因號碼與基因名稱正規化是相當重要的議題。
基因正規化的問題是將生物文獻中所提到的基因標註後,進一步轉成標準的基因資料庫編號。其挑戰性在於基因別名太多,缺乏完整的命名詞典,且有很多不同物種間共有的基因名稱相同但基因編號不同的混淆情況,因此需要確認文獻提到的基因是指何物種的基因。
「第三屆生物文獻自動探勘競賽」參賽勁旅相當多,成功大學之外,還有中央研究院、元智大學、美國國家生物科技資訊中心(NCBI)、美國亞利桑那州立大學(GNAT系統開發團隊)、美國威斯康辛大學密爾沃基分校、美國愛荷華大學、科羅拉多大學丹佛分校、大陸清華大學、蘇黎世大學、葡萄牙阿威羅大學、日本東京大學等世界名校的研究團隊。其中,有許多著名文獻探勘系統,如:GENIA、GNAT、Linnaeus、AIIA-GMT、BIOSMILE、BioThesaurus等團隊。
瀏覽數:
分享

