顯示具有 工作日誌 標籤的文章。 顯示所有文章
顯示具有 工作日誌 標籤的文章。 顯示所有文章

6/28 (四) 工作日誌

今天meeting報的論文的確覺得沒有很多的改變
感覺也很簡短
但居然能上WWW
還挺讓人覺得奇怪的

實驗的部分
admission和accepted paper算是把效果做得還不錯了
但兩個domain不太夠
目前exchange rate這個domain還在跑實驗
因為跑一次時間大約一兩個小時
還加上反覆的要去調整效果
所以目前實驗還沒有最後結果

昨天問了有關口試時間
我想我真的不夠積極與主動找老師討論
所以目前還達不到能口試的程度
我會繼續努力跟修正自己的態度
謝謝老師給我的建議

6/27 (三) 工作日誌

今天花時間在弄實驗
accepted paper我分別用不同的起始點作
以及讓她找更多相似的網站
之前相似網站只用google找了三到四次
但accepted paper似乎在找相似網站時
重複性挺高的
所以我讓她找更多的網站
但是時間也相對的更久
但找到的網頁也有多了一點

6/25 (一) 工作日誌

今天時間都花在實驗的部分
Admission和accepted paper重跑已有結果
也修改論文實驗的部分
讓結果呈現找到的url,相似度,以及是否真的為target網頁
而找銀行匯率相關網頁
由於本身對銀行網頁的階層概念沒那麼清楚
所以從首頁到匯率花了很久再找
阿岡也幫我找了一些例子
我想這也是一個理由為什麼我需要做這個系統
當使用者對一類網站階層概念不熟悉時
他能藉由標示少量的資料
來找到更多相似的網頁

6/22 (五) 工作日誌

由於實驗的部分在報告的時候
老師希望起始的網站是由使用者標示而來
所以我實驗的部分需要重新跑一次
另外實驗的domain需要多兩三個
也正在try當中
下星期會盡快給老師一個更完整的論文版本

6/21 (四) 工作日誌

今天把論文參考文獻部分整理了一下,
依照作者字母排序,也找到了一些之前該加卻沒加到的參考論文。
另外論文的名子我想改成Specific Information Gathering Using Hidden Markov Model,
不知道這樣是否切合我所做的東西呢?
覺得要加強的部分還有相關研究的整理與比較,
明天會再針對這部分做一些改善。

6/20 (三) 工作日誌

今天再改寫Introduction的部分:

我先提在Web上的資訊很多,但是很雜很廣,
而目前最主要的活動是search,
但對搜尋引擎來說,必須事先蒐集分析許多網頁。

進而帶出搜尋引擎並不是萬能的,
並提出例子說明,並解釋原因,
再進而闡述這些例子是一種特殊的資訊收集,
並提出一些相關的研究,

為了要滿足這種特殊的資訊收集,
想要用甚麼樣的方法來解決他。

6/14 (四) 工作日誌

今天報告完有許多要改的部分:

1. Introduction不夠貼切描述要做的主題,
要強調跟用search engine比,為什麼我的作法會比較好,
2. 論文跟information integration較無相關,
應想另外的名稱,
3. search跟information gathering的關聯,
4. related work部分要列出作者
5. 蒐集連覽歷程的部分可以試試其他方法
6. url keyword應加到問題定義
7. 找到的相似網頁要標示是或不是target information

6/13 (三) 工作日誌

今天重做了admission information和accept papers的實驗,
原因是之前並沒有存下相似度,
也沒有照相似度排序來保留下Top 10的結果。

今天也花了些時間在準備明天的報告。

6/12 (二) 工作日誌

今天花了時間把論文上傳到google document,
並把參考文獻以及相關的url都給附了上去。
也花了些時間整理投影片及論文。
論文摘要的部分等寫好之後會補上去!

6/11 (一) 工作日誌

今天把時間花在整理報告的投影片上,
更改不同的部分有使用者蒐集資料的處理方式,
以及增加了實驗的部分,
實驗部分目前只做了兩個domain,
還在試有哪些domain做起來效果比較好的。

6/8 (五) 工作日誌

今天在小修改程式的部分,
因為之前對於每個Google回傳回來的相似網站,
由這些網站作為開始去找相似網頁,
每找到一個大於定的閥值的網頁,
就show出來,
現在我必須相對存在他的相似度,
以及做排序,才能show出Top 10的結果。

6/7 (四) 工作日誌

今天花時間在弄實驗的部分,
我想到先做會議的accepted paper這個domain,
或許效果會好一點,
在這個domain下,相似度的threshold可以大約調到0.4-0.5,
因為accepted paper的版面都還挺類似的,
今天也問了老師,該如何評估實驗的結果,
所以我應該保留Top 10的結果,以及闡述如果由使用者自己點選瀏覽,
跟程式跑的差別在哪,藉此凸顯系統的好處!

6/6 (三) 工作日誌

今天在弄實驗相關的部分,
包括跑數據跟寫論文,
實驗主要做三個domain,
學校的入學資訊、銀行匯率、以及電腦製造商的產品
後兩個還在試怎麼樣效果會比較好。

6/5 (二) 工作日誌

今天把論文系統的部分大致上寫完,
包括Hidden Markov Model的training,
以及整個系統流程,
明天預計把實驗部分弄完,就完成了。

6/4 (一) 工作日誌

今天把時間都花在寫論文上,目前系統只寫到一半,今天花了很多時間在調論文的格式,像是目錄,reference等等,也把一些參考到的網路資源給加到了reference裡,由於進度有點延遲,系統跟實驗的部份可能需要在一兩天的時間補齊。

6/1 (五) 工作日誌

今天把時間花在寫論文上,目前還在寫系統的部分,進度有點慢,目前正寫完使用者標示資料的這個部分,剩下的部份希望能盡快寫完,希望能來得及交初稿。

5/31 (四) 工作日誌

今天做了系統demo,老師給了建議,希望能把相關的參數設定以及執行主體的地方可以放在瀏覽器的工具列上,當使用者填妥了相關參數後,便丟到背景執行,等執行結果出來後,再用訊息通知使用者並開啟連結的頁面讓使用者瀏覽,思考了一下,這樣的做法很直覺,但在程式上需要克服的一點是,要用thread來寫GUI介面,這樣才能讓使用者一邊可以繼續瀏覽網頁,一方面找尋相似網頁的主體程式也能在背景執行,這方面的程式之前沒有碰過,所以要花點時間survey一下做法,接下便是趕論文了。

5/30 (三) 工作日誌

今天還是把時間花在GUI界面上以及調整系統的效能,不過似乎結果都不是很好,對於admission這個domain來說,閥值定在0.25~0.4之間是一個比較好的選擇,有些找到的相關網頁,能夠直接命中,但有些則是需要多按個兩三個連結才能找到相關網頁,而如果是從不相關的網站開始的,則通常都找不到相關網頁,所以我有設定每個相關網站最多可以看多少個網頁的參數。

5/30 (二) 工作日誌

今天也同樣把時間花在把系統改成gui介面上,由於query google得到的相似網站並不一定都相似,所以如果每一個網站都去找相似的網頁,有可以閥值定很低了還是找不到,想說就把找到的相似網站列出來,讓使用者去挑選哪些是相似的網站,再從這些相似的網站下去找,這樣效果或許會比較好一點,但這個部分還沒完成。

5/28 (一) 工作日誌

今天把時間花在做使用者介面,試著把一些會調整的參數獨立出來,讓使用者介面可以去調整,由於之前測試都是用commend line做測試,把它做成gui介面需要點時間調整程式,而且對JAVA GUI沒有很熟,所以可能要一點時間。