)(
iii
netfy
θ
−=
j
n
j
iji
xwnet
∑
=
=
1
i
θ
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
ĐẠI HỌC QUỐC GIA THÀNH PHỐ HCM
ĐẠI HỌC CÔNG NGHỆ THÔNG TIN
BÁO CÁO THU HOẠCH MÔN HỌC
MÁY HỌC & ỨNG DỤNG
ĐỀ TÀI
MẠNG NƠRON & ỨNG DỤNG TRONG VIỆC NHẬN
DẠNG CHỮ VIẾT
TP.HCM 03/ 2014
DANH MỤC HÌNH ẢNH
Số hiệu
hình
Tên hình Trang
Mạng nơron ba lớp
13
Hình 11 Mạng truyền thẳng một lớp 14
Hình 12 Mạng truyền thẳng nhiều lớp 14
Hình 13 Mạng hồi tiếp một lớp 15
Hình 14 Mạng neural hồi quy 15
Hình 15
Cấu trúc của mạng Hopfield
16
Hình 16
Cấu trúc của BAM
17
Hình 17
Học có giám sát
19
Hình 18
Học không có giám sát
21
Hình 19
Sơ đồ cấu trúc chung của quá trình học
22
Hình 20
Mạng 3 lớp lan truyền ngược
23
Hình 21
Mối liên hệ giữa sai số và kích thước mẫu
29
Hình 22
Huấn luyện luân phiên trên hai tập mẫu
33
HVTH: Nhan Thanh Nhã Page 4
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
CHƯƠNG 1: TỔNG QUAN VỀ MÔ HÌNH MẠNG NƠRON
1.1 Giới thiệu về mạng nơron nhân tạo
1.1.1 Mạng nơron nhân tạo là gì?
Định nghĩa: Mạng nơron nhân tạo, Artificial Nơron Network (ANN) gọi tắt là mạng
nơron, nơron network, là một mô hình xử lý thông tin phỏng theo cách thức xử lý thông tin
của các hệ nơron sinh học. Nó được tạo lên từ một số lượng lớn các phần tử (gọi là phần tử
xử lý hay nơron) kết nối với nhau thông qua các liên kết (gọi là trọng số liên kết) làm việc
như một thể thống nhất để giải quyết một vấn đề cụ thể nào đó.
Một mạng nơron nhân tạo được cấu hình cho một ứng dụng cụ thể (nhận dạng mẫu,
phân loại dữ liệu, ) thông qua một quá trình học từ tập các mẫu huấn luyện. Về bản chất
học chính là quá trình hiệu chỉnh trọng số liên kết giữa các nơron.
1.1.2 Lịch sử phát triển mạng nơron
Các nghiên cứu về bộ não con người đã được tiến hành từ hàng nghìn năm nay. Cùng
với sự phát triển của khoa học kĩ thuật đặc biệt là những tiến bộ trong ngành điện tử hiện
đại, việc con người bắt đầu nghiên cứu các nơron nhân tạo là hoàn toàn tự nhiên. Sự kiện
đầu tiên đánh dấu sự ra đời của mạng nơron nhân tạo diễn ra vào năm 1943 khi nhà thần
kinh học Warren McCulloch và nhà toán học Walter Pitts viết bài báo mô tả cách thức các
nơron hoạt động. Họ cũng đã tiến hành xây dựng một mạng nơron đơn giản bằng các mạch
điện. Các nơron của họ được xem như là các thiết bị nhị phân với ngưỡng cố định. Kết quả
của các mô hình này là các hàm logic đơn giản chẳng hạn như “ a OR b” hay “a AND b”.
Tiếp bước các nghiên cứu này, năm 1949 Donald Hebb cho xuất bản cuốn sách
Organization of Behavior. Cuốn sách đã chỉ ra rằng các nơron nhân tạo sẽ trở lên hiệu quả
hơn sau mỗi lần chúng được sử dụng.
Những tiến bộ của máy tính đầu những năm 1950 giúp cho việc mô hình hóa các
nguyên lý của những lý thuyết liên quan tới cách thức con người suy nghĩ đã trở thành hiện
thực. Nathanial Rochester sau nhiều năm làm việc tại các phòng thí nghiệm nghiên cứu của
IBM đã có những nỗ lực đầu tiên để mô phỏng một mạng nơron. Trong thời kì này tính toán
Thật không may, những thành công ban đầu này khiến cho con người nghĩ quá lên về
khả năng của các mạng nơron. Chính sự cường điệu quá mức đã có những tác động không
tốt đến sự phát triển của khoa học và kỹ thuật thời bấy giờ khi người ta lo sợ rằng đã đến lúc
máy móc có thể làm mọi việc của con người. Những lo lắng này khiến người ta bắt đầu
phản đối các nghiên cứu về mạng neuron. Thời kì tạm lắng này kéo dài đến năm 1981.
Năm 1982 trong bài báo gửi tới viện khoa học quốc gia, John Hopfield bằng sự phân
tích toán học rõ ràng, mạch lạc, ông đã chỉ ra cách thức các mạng nơron làm việc và những
công việc chúng có thể thực hiện được. Cống hiến của Hopfield không chỉ ở giá trị của
những nghiên cứu khoa học mà còn ở sự thúc đẩy trở lại các nghiên cứu về mạng neuron.
1.1.3 . So sánh mạng nơron với máy tính truyền thống
Các mạng nơron có cách tiếp cận khác trong giải quyết vấn đề so với máy tính truyền
thống. Các máy tính truyền thống sử dụng cách tiếp cận theo hướng giải thuật, tức là máy
tính thực hiện một tập các chỉ lệnh để giải quyết một vấn đề. Vấn đề được giải quyết phải
được biết và phát biểu dưới dạng một tập chỉ lệnh không nhập nhằng. Những chỉ lệnh này
sau đó phải được chuyển sang một chương trình ngôn ngữ bậc cao và chuyển sang mã máy
để máy tính có thể hiểu được.
Trừ khi các bước cụ thể mà máy tính cần tuân theo được chỉ ra rõ ràng, máy tính sẽ
không làm được gì cả. Điều đó giới hạn khả năng của các máy tính truyền thống ở phạm vi
giải quyết các vấn đề mà chúng ta đã hiểu và biết chính xác cách thực hiện. Các máy tính sẽ
trở lên hữu ích hơn nếu chúng có thể thực hiện được những việc mà bản thân con người
không biết chính xác là phải làm như thế nào.
Các mạng nơron xử lý thông tin theo cách thức giống như bộ não con người. Mạng
được tạo nên từ một số lượng lớn các phần tử xử lý được kết nối với nhau làm việc song
song để giải quyết một vấn đề cụ thể. Các mạng nơron học theo mô hình, chúng không thể
được lập trình để thực hiện một nhiệm vụ cụ thể. Các mẫu phải được chọn lựa cẩn thận nếu
HVTH: Nhan Thanh Nhã Page 6
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
không sẽ rất mất thời gian, thậm chí mạng sẽ hoạt động không đúng. Điều hạn chế này là
bởi vì mạng tự tìm ra cách giải quyết vấn đề, thao tác của nó không thể dự đoán được.
Các mạng nơron và các máy tính truyền thống không cạnh tranh nhau mà bổ sung cho nhau.
Như vậy nơron sinh học hoạt động theo cách thức sau: nhận tín hiệu đầu vào, xử lý các
tín hiệu này và cho ra một tín hiệu output. Tín hiệu output này sau đó được truyền đi làm tín
hiệu đầu vào cho các nơron khác.
Dựa trên những hiểu biết về nơron sinh học, con người xây dựng nơron nhân tạo với
hy vọng tạo nên một mô hình có sức mạnh như bộ não.
1.2.2 Nơron nhân tạo
Một nơron là một đơn vị xử lý thông tin và là thành phần cơ bản của một mạng nơron.
Cấu trúc của một nơron được mô tả trên hình dưới.
Hình : Nơron nhân tạo
Các thành phần cơ bản của một nơron nhân tạo bao gồm:
♦ Tập các đầu vào: Là các tín hiệu vào (input signals) của nơron, các tín hiệu này
thường được đưa vào dưới dạng một vector N chiều.
♦ Tập các liên kết: Mỗi liên kết được thể hiện bởi một trọng số (gọi là trọng số liên
kết – Synaptic weight). Trọng số liên kết giữa tín hiệu vào thứ j với nơron k thường được kí
hiệu là w
kj
. Thông thường, các trọng số này được khởi tạo một cách ngẫu nhiên ở thời điểm
khởi tạo mạng và được cập nhật liên tục trong quá trình học mạng.
♦ Bộ tổng (Summing function): Thường dùng để tính tổng của tích các đầu vào với
trọng số liên kết của nó.
♦ Ngưỡng (còn gọi là một độ lệch - bias): Ngưỡng này thường được đưa vào như một
thành phần của hàm truyền.
♦ Hàm truyền (Transfer function) : Hàm này được dùng để giới hạn phạm vi đầu ra
của mỗi nơron. Nó nhận đầu vào là kết quả của hàm tổng và ngưỡng đã cho. Thông thường,
phạm vi đầu ra của mỗi nơron được giới hạn trong đoạn [0,1] hoặc [-1, 1]. Các hàm truyền
rất đa dạng, có thể là các hàm tuyến tính hoặc phi tuyến. Việc lựa chọn hàm truyền nào là
tuỳ thuộc vào từng bài toán và kinh nghiệm của người thiết kế mạng. Một số hàm truyền
thường sử dụng trong các mô hình mạng nơron được đưa ra trong bảng 1 .
♦ Đầu ra: Là tín hiệu đầu ra của một nơron, với mỗi nơron sẽ có tối đa là một đầu ra.
Xét về mặt toán học, cấu trúc của một nơron k, được mô tả bằng cặp biểu thức sau:
netfy
θ
−=
và
j
n
j
iji
xwnet
∑
=
=
1
trong đó: x
1
, x
2
, …x
m
là các tín hiệu đầu vào, còn w
i1
, w
i2
,…,w
im
là các trọng số kết nối của
neuron thứ i, net
i
là hàm tổng, f là hàm truyền,
i
xkhi
xy
(2)
- Hàm bậc thang
<
≤≤
>
==
00
10
11
)sgn(
xkhi
xkhix
xkhi
xy
(3)
- Hàm ngưỡng đơn cực
x
λ
−
+
=
e
y
1.3.1. Các kiểu mô hình mạng nơron
Cách thức kết nối các nơron trong mạng xác định kiến trúc (topology) của mạng. Các
nơron trong mạng có thể kết nối đầy đủ (fully connected) tức là mỗi nơron đều được kết nối
với tất cả các nơron khác, hoặc kết nối cục bộ (partially connected) chẳng hạn chỉ kết nối
giữa các nơron trong các tầng khác nhau. Người ta chia ra hai loại kiến trúc mạng chính:
♦ Tự kết hợp (autoassociative): là mạng có các nơron đầu vào cũng là các nơron đầu
ra. Mạng Hopfield là một kiểu mạng tự kết hợp.
Hình 4: Mạng tự kết hợp
HVTH: Nhan Thanh Nhã Page 10
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
♦ Kết hợp khác kiểu (heteroassociative): là mạng có tập nơron đầu vào và đầu ra riêng
biệt. Perceptron, các mạng Perceptron nhiều tầng (MLP: MultiLayer Perceptron), mạng
Kohonen, … thuộc loại này.
Hình 5: Mạng kết hợp khác kiểu
Ngoài ra tùy thuộc vào mạng có các kết nối ngược (feedback connections) từ các
nơron đầu ra tới các nơron đầu vào hay không, người ta chia ra làm 2 loại kiến trúc mạng.
♦ Kiến trúc truyền thẳng (feedforward architechture): là kiểu kiến trúc mạng không có
các kết nối ngược trở lại từ các nơron đầu ra về các nơron đầu vào; mạng không lưu lại các
giá trị output trước và các trạng thái kích hoạt của nơron. Các mạng nơron truyền thẳng cho
phép tín hiệu di chuyển theo một đường duy nhất; từ đầu vào tới đầu ra, đầu ra của một tầng
bất kì sẽ không ảnh hưởng tới tầng đó. Các mạng kiểu Perceptron là mạng truyền thẳng.
Hình 6: Mạng truyền thẳng
♦ Kiến trúc phản hồi (Feedback architecture): là kiểu kiến trúc mạng có các kết nối từ
nơron đầu ra tới nơron đầu vào. Mạng lưu lại các trạng thái trước đó, và trạng thái tiếp theo
không chỉ phụ thuộc vào các tín hiệu đầu vào mà còn phụ thuộc vào các trạng thái trước đó
của mạng. Mạng Hopfield thuộc loại này.
HVTH: Nhan Thanh Nhã Page 11
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
Hình 7: Mạng phản hồi
1.3.2. Perceptron
Hoạt động của mạng MLP như sau: tại tầng đầu vào các nơron nhận tín hiệu vào xử lý (tính
tổng trọng số, gửi tới hàm truyền) rồi cho ra kết quả (là kết quả của hàm truyền); kết quả
này sẽ được truyền tới các nơron thuộc tầng ẩn thứ nhất; các nơron tại đây tiếp nhận như là
tín hiệu đầu vào, xử lý và gửi kết quả đến tầng ẩn thứ 2;…; quá trình tiếp tục cho đến khi
các nơron thuộc tầng ra cho kết quả.
Một số kết quả đã được chứng minh:
♦ Bất kì một hàm Boolean nào cũng có thể biểu diễn được bởi một mạng MLP 2 tầng trong
đó các nơron sử dụng hàm truyền sigmoid.
♦ Tất cả các hàm liên tục đều có thể xấp xỉ bởi một mạng MLP 2 tầng sử dụng hàm
truyền sigmoid cho các nơron tầng ẩn và hàm truyền tuyến tính cho các nơron tầng ra với
sai số nhỏ tùy ý.
♦ Mọi hàm bất kỳ đều có thể xấp xỉ bởi một mạng MLP 3 tầng sử dụng hàm truyền
sigmoid cho các nơron tầng ẩn và hàm truyền tuyến tính cho các nơron tầng ra.
1.4 Cấu tạo và phương thức làm việc của mạng nơron
Dựa trên những phương pháp xây dựng neuron đã trình bày ở mục trên, ta có thể hình
dung mạng nơron như là một hệ truyền đạt và xử lý tín hiệu. Đặc tính truyền đạt của neuron
phần lớn là đặc tính truyền đạt tĩnh.
Khi liên kết các đầu vào/ra của nhiều neuron với nhau, ta thu được một mạng nơron,
việc ghép nối các neuron trong mạng với nhau có thể là theo một nguyên tắc bất kỳ. Vì
mạng nơron là một hệ truyền đạt và xử lý tín hiệu, nên có thể phân biệt các loại neuron khác
nhau, các neuron có đầu vào nhận thông tin từ môi trường bên ngoài khác với các neuron có
đầu vào được nối với các neuron khác trong mạng, chúng được phân biệt với nhau qua
vector hàm trọng số ở đầu vào w.
HVTH: Nhan Thanh Nhã Page 13
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
Nguyên lý cấu tạo của mạng nơron bao gồm nhiều lớp, mỗi lớp bao gồm nhiều neuron có
cùng chức năng trong mạng. Hình 9 là mô hình hoạt động của một mạng nơron 3 lớp với 8
phần tử neuron. Mạng có ba đầu vào là x
1
, x
không đầy đủ hoặc bị tác động của nhiễu. Mạng neural kiểu này được ứng dụng trong lĩnh
vực hoàn thiện mẫu, trong đó có một ứng dụng cụ thể là nhận dạng chữ viết.
- Nhiệm vụ tổng quát của một mạng neural là lưu giữ động các thông tin. Dạng thông
tin lưu giữ này chính là quan hệ giữa các thông tin đầu vào và các đáp ứng đầu ra tương
ứng, để khi có một kích thích bất kỳ tác động vào mạng, mạng có khả năng suy diễn và đưa
ra một đáp ứng phù hợp. Đây chính là chức năng nhận dạng theo mẫu của mạng neural. Để
thực hiện chức năng này, mạng neural đóng vai trò như một bộ phận tổ chức các nhóm
thông tin đầu vào, và tương ứng với mỗi nhóm là một đáp ứng đầu ra phù hợp. Như vậy,
một nhóm bao gồm một loại thông tin đầu vào và một đáp ứng đầu ra. Các nhóm có thể
được hình thành trong quá trình học, và cũng có thể không hình thành trong quá trình học.
HVTH: Nhan Thanh Nhã Page 14
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
1.4.1. Mạng neural một lớp
Mỗi một neuron có thể phối hợp với các neuron khác tạo thành một lớp các trọng số.
Mạng một lớp truyền thẳng như hình 10. Một lớp neuron là một nhóm các neuron mà chúng
đều có cùng trọng số, nhận cùng một tín hiệu đầu vào đồng thời.
Hình 11: Mạng truyền thẳng một lớp
Trong ma trận trọng số, các hàng là thể hiện neuron, hàng thứ j có thể đặt nhãn như một
vector w
j
của neuron thứ j gồm m trọng số w
ji
. Các trọng số trong cùng một cột thứ j
(j=1,2, ,n) đồng thời cùng nhận một tín hiệu đầu vào x
j
.
w
j
= [w
j1
của các neuron cùng lớp được gọi là mạng Laeral như hình 13
HVTH: Nhan Thanh Nhã Page 15
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
Hình 13: Mạng hồi tiếp một lớp
1.4.4. Mạng neural hồi quy
Hình 14: Mạng neural hồi quy
Mạng neural phản hồi có thể thực hiện đóng vòng được gọi là mạng neural hồi quy như hình
14. Mạng neural hồi quy có trọng số liên kết đối xứng như mạng Hopfield, mạng luôn hội tụ
về trạng thái ổn định (Hình13). Mạng BAM thuộc nhóm mạng neural hồi quy, gồm 2 lớp
liên kết 2 chiều, không được gắn với tín hiệu vào/ra. Nghiên cứu mạng neural hồi quy mà có
trọng số liên kết không đối xứng, thì sẽ gặp phải vấn đề phức tạp nhiều hơn so với mạng
truyền thẳng và mạng hồi quy có trọng số liên kết đối xứng.
1.4.5. Mạng Hopfield
Mạng Hopfield là mạng phản hồi một lớp, được chỉ ra trong hình 13. Cấu trúc chi tiết của
nó được thể hiện trong hình 15. Khi hoạt động với tín hiệu rời rạc, nó được gọi là mạng
Hopfield rời rạc, và cấu trúc của nó cũng được gọi là mạng hồi quy.
HVTH: Nhan Thanh Nhã Page 16
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
Hình 15: Cấu trúc của mạng Hopfield
Như mạng Hopfield đã vẽ ở trên, ta thấy nút có một đầu vào bên ngoài x
j
và một giá trị
ngưỡng
j
θ
(j = 1,2, n). Một điều quan trọng cần nói ở đây là mỗi nút không có đường phản
hồi về chính nó. Nút đầu ra thứ j được nối tới mỗi đầu vào của nút khác qua trọng số w
ij
, với
i
j
i
k
jij
k
i
xywy
θ
i = 1,2, ,n (6)
Luật cập nhật trên được tính toán trong cách thức không đồng bộ. Điều này có nghĩa là, với
một thời gian cho trước, chỉ có một nút mạng cập nhật được đầu ra của nó. Sự cập nhật tiếp
theo trên một nút sẽ sử dụng chính những đầu ra đã được cập nhật. Nói cách khác, dưới hình
thức hoạt động không đồng bộ của mạng, mỗi đầu ra được cập nhật độc lập.
Có sự khác biệt giữa luật cập nhật đồng bộ và luật cập nhật không đồng bộ. Với luật
cập nhật không đồng bộ thì sẽ chỉ có một trạng thái cân bằng của hệ (với giá trị đầu đã được
xác định trước). Trong khi đó, với luật cập nhật đồng bộ thì có thể làm mạng hội tụ ở mỗi
điểm cố định hoặc một vòng giới hạn.
1.4.6. Mạng BAM
Mạng BAM bao gồm hai lớp và được xem như là trường hợp mở rộng của mạng Hopfield.
Ở đây ta chỉ xét mạng rời rạc, vì nó đơn giản và dễ hiểu.
Hình 16: Cấu trúc của BAM
Khi mạng neural được tích cực với giá trị đầu vào của vector tại đầu vào của một lớp, mạng
sẽ có hai mẫu trạng thái ổn định, với mỗi mẫu tại đầu ra của nó là một lớp. Tính động học
của mạng thể hiện dưới dạng tác động qua lại giữa hai lớp. Cụ thể hơn, giả sử một vector
đầu vào x được cung cấp cho đầu vào của lớp neuron y. Đầu vào được xử lý và truyền tới
đầu ra của lớp y như sau:
y’ = a(wx) ;
; với j = 1,2, ,m (2)
HVTH: Nhan Thanh Nhã Page 17
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
Sau đó x’ nuôi trở lại đầu vào của lớp y và tạo ra hàm y’’ theo phương trình (1). Quá trình
này cứ tiếp tục, bao gồm các bước như sau:
y
(1)
= a(wx
(0)
) (truyền thẳng lần thứ nhất)
x
(2)
= a(w
(T)
y
(1)
) (truyền ngược lần thứ nhất)
y
(3)
= a(wx
(2)
) (truyền thẳng lần thứ hai)
x
(4)
= a(w
(T)
y
(3)
) (truyền ngược lần thứ hai) (3)
Có ba phương pháp học phổ biến là học có giám sát (supervised learning), học không
giám sát (unsupervised learning) và học tăng cường (Reinforcement learning):
♦ Học có giám sát: Là quá trình học có sự tham gia giám sát của một “thầy giáo”.
Cũng giống như việc ta dạy một em nhỏ các chữ cái. Ta đưa ra một chữ “a” và bảo với em
đó rằng đây là chữ “a”. Việc này được thực hiện trên tất cả các mẫu chữ cái. Sau đó khi
kiểm tra ta sẽ đưa ra một chữ cái bất kì (có thể viết hơi khác đi) và hỏi em đó đây là chữ gì?
học có giám sát, thì tại mỗi thời điểm khi đầu vào được cung cấp tới mạng neural, phản ứng
đầu ra mong muốn d tương ứng của hệ thống được đưa ra. Ở hình 16, khi mỗi đầu vào x
(k)
được đặt vào mạng, đầu ra mong muốn tương ứng d
(k)
cũng được cung cấp tới mạng. Hiệu
giữa đầu ra thực y
(k)
và đầu ra mong muốn d
(k)
được đo trong máy phát tín hiệu lỗi. Máy này
sẽ tạo ra tín hiệu lỗi cho mạng để hiệu chỉnh các trọng số của mạng, và với các hiệu chỉnh
này thì đầu ra thực sẽ tiến sát với đầu ra mong muốn.
Hình 17: Học có giám sát
Với học có giám sát, tập mẫu huấn luyện được cho dưới dạng D = {(x,t) | (x,t) ∈ [IR
N
x
R
K
]}, trong đó: x = (x
1
, x
2
, , x
2
, . . ., y
m
) ∈ Y được cho trước. Học có giám sát trong các mạng
nơron thường được thực hiện theo các bước sau:
♦ B1: Xây dựng cấu trúc thích hợp cho mạng nơron, chẳng hạn có (n + 1) nơron vào
(n nơron cho biến vào và 1 nơron cho ngưỡng x
0
), m nơron đầu ra, và khởi tạo các trọng số
liên kết của mạng.
♦ B2: Đưa một vector x trong tập mẫu huấn luyện X vào mạng
♦ B3: Tính vector đầu ra o của mạng
♦ B4: So sánh vector đầu ra mong muốn y (là kết quả được cho trong tập huấn luyện)
với vector đầu ra o do mạng tạo ra; nếu có thể thì đánh giá lỗi.
♦ B5: Hiệu chỉnh các trọng số liên kết theo một cách nào đó sao cho ở lần tiếp theo
khi đưa vector x vào mạng, vector đầu ra o sẽ giống với y hơn.
♦ B6: Nếu cần, lặp lại các bước từ 2 đến 5 cho tới khi mạng đạt tới trạng thái hội tụ.
Việc đánh giá lỗi có thể thực hiện theo nhiều cách, cách dùng nhiều nhất là sử dụng lỗi tức
thời: Err = (o - y), hoặc Err = |o - y|; lỗi trung bình bình phương (MSE: mean-square error):
Err = (o- y)
2
/2;
Có hai loại lỗi trong đánh giá một mạng nơron. Thứ nhất, gọi là lỗi rõ ràng (apparent
error), đánh giá khả năng xấp xỉ các mẫu huấn luyện của một mạng đã được huấn luyện.
Thứ hai, gọi là lỗi kiểm tra (test error), đánh giá khả năng tổng quá hóa của một mạng đã
được huấn luyện, tức khả năng phản ứng với các vector đầu vào mới. Để đánh giá lỗi kiểm
tra chúng ta phải biết đầu ra mong muốn cho các mẫu kiểm tra.
Thuật toán tổng quát ở trên cho học có giám sát trong các mạng nơron có nhiều cài
đặt khác nhau, sự khác nhau chủ yếu là cách các trọng số liên kết được thay đổi trong suốt
thời gian học. Trong đó tiêu biểu nhất là thuật toán lan truyền ngược.
j
(j = 1,2, ,m), có thể được lấy từ đầu ra của các neuron khác hoặc
có thể được lấy ra từ bên ngoài. Trọng số của neuron thứ i được thay đổi tùy theo tín hiệu ở
đầu vào mà nó thu nhận giá trị đầu ra của nó.
Dạng tổng quát của luật học trọng số của mạng neural cho biết số gia của vector w
i
là
i
w
∆
tỉ lệ với tín hiệu học r và tín hiệu đầu vào x(t).
i
w
∆
(t) =
)( txr
η
(10)
η
là một số dương và được gọi là hằng số học dùng để xác định tốc độ học, r là tín hiệu học
và phụ thuộc:
).,,(
iir
dxwfr
=
(11)
Hình 19: Sơ đồ cấu trúc chung của quá trình học
Từ hình 18 ta thấy, vector trọng số w
i
= [w
không có giám sát, hoặc học củng cố là tín hiệu học r. Như vậy, đối với tín hiệu học r thì nó
làm thế nào để thay đổi hoặc cập nhật trọng số trong mạng neural.
Mạng neural nhân tạo có các tính chất sau:
- Là hệ phi tuyến
- Là hệ xử lý song song
HVTH: Nhan Thanh Nhã Page 21
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
- Là hệ học và thích nghi: Mạng được luyện từ số liệu quá khứ, có khả năng tự chỉnh
đầu vào khi số liệu đầu vào bị mất.
- Là hệ nhiều biến, nhiều đầu vào, nhiều đầu ra (MISO), rất tiện dùng khi điều khiển
đối tượng có nhiều biến số.
HVTH: Nhan Thanh Nhã Page 22
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
CHƯƠNG 3: THUẬT TOÁN LAN TRUYỀN NGƯỢC
3.1. Thuật toán lan truyền ngược
Thuật toán lan truyền ngược được ứng dụng để giải các bài toán điều khiển các hệ phi tuyến
phức tạp và bất ổn định. Lan truyền ngược là một phương pháp cho phép xác định tập trọng
số tốt nhất của mạng để giải một bài toán đã cho. Việc áp dụng phương pháp lan truyền
ngược là một quá trình lặp đi lặp lại nhiều lần hai tiến trình chính: lan truyền tiến để thực
hiện ánh xạ và lan truyền ngược sai số để cập nhật các trọng số. Các trọng số của mạng là
các hệ số của mô hình. Phương pháp giảm gradient được dùng để cập nhật những hệ số này
sao cho giảm thiểu được sai số của mô hình.
Xét lớp mạng 3 lớp như hình 19
Hình 20: Mạng 3 lớp lan truyền ngược
Thuật toán: Đầu tiên ta cho lan truyền thẳng suốt trong mạng, qua các phần tử neuron và
được tiếp tục với các hàm kích hoạt của phần tử neuron. Các mạng được nghiên cứu cùng
với thuật toán học lan truyền ngược được gọi là mạng lan truyền ngược.
Huấn luyện các cặp vào/ra.
{(x
(k)
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
j
m
j
qjq
xvnet
∑
=
=
1
(1)
Phương trình đầu ra của q sẽ là:
()( anetaz
qq
==
j
m
j
qj
xv
∑
=1
) (2)
Đầu vào phần tử thứ i của lớp đầu ra sẽ là:
)(
111
j
m
j
qj
qua các lớp mạng neural. Trước khi ta đề cập đến các tín hiệu sai số của sự lan truyền
ngược, ta sẽ định nghĩa một hàm mục tiêu như sau:
[ ]
2
1 1
2
11
2
2
1
)(
2
1
)(
2
1
)(
∑ ∑∑∑
= ===
∂
∂
−=∆
η
(6)
Sử dụng các công thức (8,10) và thay đổi luật với
iq
w
E
∂
∂
, ta có:
[ ][ ]
[ ]
qoiqiii
iq
i
i
i
i
i
i
iq
zznetayd
w
net
net
net
net
y
∂
∂
∂
−=∆ )('
(7)
Trong đó,
oi
δ
là tín hiệu sai số, chỉ số dưới thứ hai là điểm thứ i trong lớp đầu ra. Sai số tín
hiệu được định nghĩa bởi:
[ ][ ]
)('
iii
i
i
ii
oi
netayd
net
y
y
E
net
E
neta
neta
∂
∂
=
)(
)('
.
Bây giờ ta phải tính đầu ra z
q
của lớp ẩn:
Với trọng số nối giữa đầu vào và các lớp ẩn, ta sử dụng thay đổi luật cùng phương pháp độ
dốc Gradient, ta cập nhật trọng số để kết nối giữa phần tử thứ j của lớp đầu vào với phần tử
thứ q của lớp ẩn. Khi đó:
∂
∂
∂
∂
−=
∂
∂
−=∆
qj
q
q
q
qqj
q
qqj
qj
v
net
net
z
z
(10)
Sử dụng công thức (8), ta có thể viết lại công thức (10) như sau:
HVTH: Nhan Thanh Nhã Page 24
Đồ Án: Máy Học & Ứng Dụng PGS TS: Vũ Thanh Nguyên
[ ]
jhqjq
n
i
iqoiqj
xxnetawv
∂=−=∆
∑
=
ηδη
).('
1
(11)
Ở đây,
hq
∂
là sai số tín hiệu của phần tử thứ q của lớp ẩn và được định nghĩa như dưới đây:
iq
n
i
oiq
q
q
qq
hq
wneta
∂
∂
−=∂
1
)('
δ
(12)
Trong đó, net
q
là đầu vào phần tử thứ q của lớp ẩn.
Tín hiệu sai số của một phần tử trong lớp ẩn khác so với tín hiệu sai số của một phần tử
trong lớp đầu ra, như đã được chỉ ra trong công thức (12) và (8). Do có sự khác nhau này,
nên các thủ tục cập nhật các trọng số trên được gọi là luật học delta tổng quát. Chúng ta xem
xét công thức (12), sai số tín hiệu
hq
∂
của phần tử lớp ẩn q có thể được xác định trong các
mẫu của các tín hiệu sai số
oi
δ
của các phần tử ở lớp ra thứ i (y
i
) cung ứng. Các hệ số là các
trọng số được sử dụng cho lan truyền thẳng, nhưng ở đây chúng truyền các tín hiệu sai số (
oi
δ
) ngược trở lại, đó chính là các đường nét đứt trong hình 19. Điều này đã chứng tỏ được
đặc điểm quan trọng của thuật toán lan truyền ngược – luật cập nhật cục bộ, đây chính là
tính toán trọng số thay đổi dựa vào sự kết nối, và chúng ta chỉ cần giá trị ở hai đầu của kết
nối này.
[ ]
)1(
2
1
)(1
2
1)(
)('
22
yneta
net
neta
neta −=−=
∂
∂
=
[ ]
iioi
ydy −−= )1(
2
1
2
δ
(14)
iq
n
i
oihq
wz
∑
y
i
.
Đầu vào: các cặp huấn luyện {x
(k)
, d
(k)
| k=1,2, ,p}, ở đó giá trị đầu vào của phần tử cuối
cùng bằng -1, tức là
1
)(
1
−=
+
k
m
x
.
Bước 0 (Đặt giá trị ban đầu)
- Lựa chọn bước tính (Hằng số học) 0<η<1 và E
max
(sai số lớn nhất cho phép).
HVTH: Nhan Thanh Nhã Page 25