顯示具有 Machine Learning 標籤的文章。 顯示所有文章
顯示具有 Machine Learning 標籤的文章。 顯示所有文章

2016年12月2日 星期五

2016/12/2 Machine Learning

今天上到7.1.4的部分,
講完SVM的數學, 再講到SVM和logistic regression的error function有很高的相似性
SVM是minitor那些分錯的點, 落在margin內的點, 讓他們最少化
logistic regression則是用現有數據點算一個迴歸線, 基本上概念是很像的,
因為迴歸線周圍的點也不會剛好在迴歸線上, 也可以視為, 迴歸線周圍有一個margin



2016年11月25日 星期五

2016/11/25 Machine Learning

有沒有"說一套做一套"的最佳典範?????!!!!!!

不是說觀念比較重要    推導細節不重要嗎???!!!!

那你的題目怎麼都是計算推導阿!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!


怕影響GPA  目前正在考慮退選了....QQ

- - -

今天繼續上Ch6  Gaussian Process的Classification部分
Ch7.1 Maximum Margin Classifiers





2016年11月17日 星期四

Machine Learning hw#2


出了出了~~~~QQ
https://drive.google.com/open?id=0B57k_NHxboqhSFN0RUNiVGkwUEk
截止日期:2016/12/02 23:59

目前策略是先用sklearn寫一次跑答案, 再想辦法把它改成無sklearn的版本

助教說明錄音檔(.aac)
https://drive.google.com/open?id=0B57k_NHxboqhSVFCNnpDbWk1Vms

2016年11月11日 星期五

2016/11/11 ML midterm


  • 考六題,都是推導題。沒有直接出課本例題,也沒有出作業,出的是手寫講義上的推導。
  • 考題被收回去。
  • 以第四章出的比率最重(有兩題),這應該代表第四章最重要,但是第四章卻是最後(上週)講,也花最少時間講。
  • 這次根本是在比誰的小抄抄得比較齊全。小抄無敵重要。要好好作。
  • 這堂課是困難版的統計。在修統計課遇到的問題,這裡也通通遇到了。所以本質上它是門數學課。
  • 要預習,要複習,只懂觀念沒有用。講義要自己推導一次。
  • 沒有考好。只能指望期末考救分數了。QQ
  • 下次比較知道怎麼準備了。...基本上就是全部都考數學推導。所以那些跟老師問計算細節的同學是對的,在學校裡要應付考試要拿高分,就是要鑽牛角尖。
  • 其實我比較喜歡"考多次,每次佔分不高"的模式,我可以比較熟悉考試模式,即使第一二次沒考好,後面也有機會拉回來。對我這種常常要不到考古題的邊緣人,這還蠻重要的。而且也不會造成學期初很閒,學期末快忙炸的極端狀況。
小抄:








2016年11月9日 星期三

Machine Learning應考策略



其實完全無策略XD

無考古題, 完全不知道會怎麼考,
目前只知道會從課本例題出(ch1-4一章一題?),可能會再加一題作業吧
可以帶a4小抄,考ch1-ch4, 大約5題

假如全部都出推導題   我就完了QQ
希望可以出觀念題  這樣還有救

說真的光是上課聽懂已經很吃力了
觀念的建立已經是那麼困難
更不要說觀念背後的數學推導, 也只知道個大概
並沒有把他實際算過一次

(我應該更認真些的..希望不要走到把某科二退的命運)

這禮拜完全沒有心情上課, 遍佈式和正規都翹掉了

- - -

川普當選之後突然有動力畢業了 = =

- - -

重點:

Ch1. Entropy & KL-divergence
Ch2. Prior-Likelihood-Posterier  (最後面放棄QQ)
Ch3. Regression
Ch4. Classification



2016年11月3日 星期四

2016/11/4 Machine learning

下週考試可以帶a4小抄,考到ch4, 大約5題
從作業.textbook例題出,考試題目不會超出課本範圍

- - -
hw1 -- 98

竟然有抓抄襲, 很可怕,
因為我1,2題有參考晨晨的
3,4題的code也有給晨晨, 只是我後來整個大改寫
所以交出去的code長得已經完全不一樣了

我個人是覺得, 紙本部分他不會抓抄襲, (因為沒有自動比對程式)
只有程式題才有機會被抓, 被抓到直接*0.3, 粉可怕
但是其實我們都有互相討論阿....只是code還是要自己寫過

覺得這門課以後還是不要直接share答案, 不管是被shared, 還是share給別人

話說這門課怎麼這麼硬... 硬度根本是其他三門的總和
每次禮拜五都覺得壓力頗大
- - -

今天把ch4在三小時內通通上完
根本就是在趕課阿

ch4講classification的數學原理
比較重要的是logistic regression和它的Laplace近似

logistic regression是指函數輸出時, 有用一個sigmiod function去做轉換
這跟在regression裡提到的sigmoid基底函數不同

logistic regression基本上不是Regression, 而是一個Classification問題
Regression的輸出是連續, 不是label型態, 也比較容易找得到close form

Regression和Classification最大的差別,
在於Classification還有外加一個輸出函數(可以想像成是類神經網路的激活函數)
Regression沒有
但兩者都可以對X取基底函數

logistic regression的Laplace近似其實就是用二次微分的泰勒展開式去逼近一個高斯分布

2016年10月29日 星期六

Machine Learning hw#1

due day延到10/30

PRML全書電子檔
hw1 題目

hand-in solution:
hw1 prob3&4 report (程式題)

code:
1. Prob3 without sklearn (hand-in)
2. Prob4 without sklearn (hand-in)
3. Prob3 with sklearn
4. Prob4 with sklearn

- - -

Q: python的套件sklearn是可以使用的嗎?
A:
    不知道妳要用sklearn哪部分,但不能直接使用 sklearn 的  regression 功能,基本上 model 建立部份禁止使用,若像 load data format 之類(etc. Scipy.loadmat() )功能話,則可以使用。
                                 TA

- - -


本次作業因為一開始不知道sklearn能不能用
兩種版本都寫了

所謂的without sklearn (sklearn是一種toolkit)
指的就是"直接用數學式子"算出機器學習的答案
這個過程然比較折磨

這次作業的程式題我總共重寫三次, 修修改改一個禮拜
我一開始是without sklearn寫了一個版本
後來遇到瓶頸, 寫不下去
覺得需要用sklearn先知道答案,
就用sklearn再寫一次 (code當然簡潔很多)
原本打算就這樣交了
後來知道sklearn不被允許使用
又回過頭去再改成without sklearn的版本

最後的答案with和without sklearn的有一點點小誤差
不過還算可以接受

3-2題原本在sklearn裡可以用Lasso求解
without sklearn的情況下, 就只好照著題目的描述, 不加regularization項
而只是單純針對各attribute求算RMS, 再取最小的

比較奇怪的是,
兩種做法我都有將weight function列出來,
|weight|較大的基底函數也嘗試列出來
但是with和without sklearn的結果似乎都不相同?

總之是很紮實的一份作業, 有應用, 有推導
也加深了我對課堂內容的吸收和了解

2016年10月20日 星期四

2016/10/21 Machine Learning


今天講的東西終於跟之前聽過的課程重疊到
所以終於一次聽懂了~~感動

- - -

這門課每次到了下課,就會有一堆同學
像蒼蠅遇到_一樣圍著老師猛問
而我就是其中一隻大蒼蠅
不過我發問都是問概念 很怕自己對概念有一點點不了解
而不像其他正統學院風的同學 對一些計算細節窮追猛打
老師人很好 從來不會失去耐心
但我承認 對於那些追著計算細節窮追猛打的同學 
佩服之餘也是稍稍有些不耐
我覺得這不符合機器學習這門課的精神
明明老師就是為了節省時間 故意略過細節不講
這樣又逼得老師要再花時間把那些細節拿到課堂上詳細推導一次
或許是工作養成的習慣
對於無意義的追根究柢感到過敏  
- - -

Ch3 Linear Model for Regression

3.1 Linear Bayes function
3.2 Bias-Vraiance delimma
E(w) = E_D(w) + E_W(w)

2016年10月13日 星期四

2016/10/14 Machine Learning


今晚公布第一次作業
--
今天會把chap2上完,
講T-dist, Gaussian-dist的一些特性, 數學上的一些技巧
Exponential family dist.發展出conjutive prior

再來會上chap3大約1/3
什麼叫sparse? 如何找出sparse的解

上課主要抓main idea, 再透過hw去練習一些細節
hw可以用library但不能一式到位, 思路必須用code表達出來





2016年10月6日 星期四

2016/10/7 Machine Learning



期中考可以帶A4小抄
---

上次結束掉ch1, decision theory和information theory在ML的角色
上了Entropy及延伸出來的KL-divergence概念
主要用來測量一個機率分布是不是夠理想, 有多理想
也就是說, 我們所假設的機率分布p(x), 與我們實際觀測到的機率分布q(x)到底差距多遠
---
今天開始上Ch2 Probability Distribution (課程手稿講義p.19)
本次介紹在三種資料下的model, 以及其各自適用的機率分布,
重點在於介紹該如何從先驗機率(prior)推導至後驗機率(posterior)
以及證明各自的先驗(prior)機率模型及後驗(posterior)機率模型會剛好相同,
這也表示, 貝式learning方法可以支援sequential learning


三種資料:
1. {0,1}  整數 -> binomial
2. {....,-2,-1,0,1,2,....} 整數 ->  multinomial
3. {3.14159, 1, -1, ....}實數 ->  Gaussian

第二種例如text mining, 第三種例如signal
以上所提的三種model: binomial, multinomial, Gaussian指的是likelihood所取用的model
我們發現
type_1的prior取用Beta時,
其"conjugate prior", 也就是posterier, 也會是 Beta;
type_2的prior取用Dirchlet時,
其"conjugate prior", 也就是posterier, 也會是 Dirchlet;
type_3的prior取用Gaussian-Gamma時,
其"conjugate prior", 也就是posterier, 也會是 Gaussian-Gamma;

其公式為:
posterier = likelihood * prior
P( 未知參數 | data, 超參數 ) 
=  P( data |未知參數 ) * P( 未知參數 | 超參數 )
超參數是指一個在計算過程中假設為固定的參數, 也是我們真正可以learn到的東西

整堂課就在進行以上所述的證明,
我們藉由不斷調整prior(簡單一點說, 就是tune機率分布的參數),
以學習到更正確的先驗機率
藉此提高prediction的準確率

其prediction公式為:
p(x=1|data) = 積分 { p(x=1|未知參數) * posterier }
----





2016年9月29日 星期四

2016/9/30 machine learning


上禮拜為了交加簽單提早走,沒點到名,
一直以為這堂選上的課會被drop掉,頗崩潰

- - -

突然想起我今天這堂課好像沒簽到任何名字之類的...
是沒點名,還是我沒點到名?

----
ECM5901 最佳化理論與應用 Optimization Theory and Application
4BCD-EDB26  授課教師:劉俊宏
可以去旁聽
- - -

今天下課有問老師問題

問說那個λ對於conatrains的意義
結果馬上被身後一個大陸口音的同學打岔
要我回去自己查Lagrange multiplier
我查了維基百科
突然想起,這不是線性代數第一堂課老師有教過的函數逼近法嗎?
真糟糕,全都還給老師了

- - -

13:10-14:00
review last course
(1)decision theory
Find misclassification rate
<meth 1>當各種分類錯誤的嚴重性(權重)相同,使用最簡單的畫出函數找交點
<meth 2>最小化expected loss--minimize Baye's risk
    當分類錯誤嚴重性不同,例如:肺癌誤診不嚴重,應檢出而未檢出較嚴重
    使用loss matrix做加權

三種方法(歷史演進):
1. Discriminate function
2. Generative model
3. Discriminative model -> ch4 logistic regression

14:20-16:10
(2)Information Theorem
這一節講Entropy, 基本上就是定義成負亂度
所以data越可以預測,越整齊,與model變異越小,Entropy就越大
然後我們目的是要最大化Entropy

介紹了一種constrained optimitor
基本上就是Lagrange multiplier的一種實現形式
推導出最佳化的機率分布是高斯分布

接下來他把Entropy的概念應用在Kullback–Leibler divergence
簡單的說就是有一個理想的機率分布p(x)
我們用一個函數q(x)去近似它
KL divergence是實際的Entropy減去理想的Entropy,也就是理想與現實的差距

接下來要證明 KL(  p(x) ||  q(x) ) 恆大於等於0
這個證明暫且跳過

再來,這個q(x)要怎麼挑?
那就是使用統計裡的max. likelihood方法
q(x)裡一定有一些待定的參數,假設是θ
那麼我們就可以在q(x|θ) 裡固定x找最大機率的q(x|θ)
得到的θ就是估計的θ,就可以決定q
這個θ也可以用最小化KL(  p(x) ||  q(x|θ) )去估計得到
    




2016年9月26日 星期一

2016/09/23 機器學習




簡仁宗老師開的Machine Learning,是我這學期的重點課

這門課根據老師的說法,是將他以往教的"基礎機器學習"和"高等機器學習"合併成一堂,所以沒有意外應該會非常的重。另外,他下學期會開deep learning

看一下課綱:

1. Introduction
2. Probability Distributions
3. Linear Models for Regression
4. Linear Models for Classification
5. Kernel Methods
6. Sparse Kernel Methods
7. Mixture Models and EM
8. Approximate Inference 


,看起來都挺熟悉的。有看林軒田老師的視頻先預習,哈哈


Grading:
Midterm Exam (30%), Final Exam (40%), Homework (30%), Class Attendance (<30%)
感覺佛心來的,是怕當掉太多人嗎
說到Class Attendance, 這門課有5名助教。上課點一次,下課再點一次


教科書:
C. M. Bishop, Pattern Recognition and Machine Learning, Springer, 2006.
聽說是比較難的一本,我在網路上找到了全文電子檔


這門課修課人數超多的,簡直可以用爆炸來形容。當天在教室裡坐了近200人,其中可能有一半是要加簽的。幸好有選到這門課