Minggu, 28 Agustus 2011

Missing data analysis dalam multivariat

Missing data atau missing value adalah informasi yang tidak tersedia untuk sebuah subyek (kasus). Dalam alat statistik,missing data adalah adanya sel-sel kosong pada satu atau beberapa variabel. missing data terjadi karena informasi untuk sesuatu tentang objek tidak diberikan,sulit dicari atau memang informasi teresbut tidak ada.

Missing data pada dasarnya tidak bermasalah bagi keseluruhan data,apalagi jika jumlahnya hanya sedikit namun jika presentase data yang hilang tersebut ckup besar, maka perlu dilakukan pengujian apakah data yang mengandung missing tersebut masih layak diproses lebih lanjut ataukah tidak.

Jika pada sebuah data ditemukan adanya missing data (value) dan data yang hilang(missing) tersebut terbukti bersifat random perlu dilakuakn berbagai treatment.Random disini berarti missing value yang terjadi tidak disengaja dan tidak mengacu keadaan tertentu.
Treatment yang dapat dilakukan adalah
  • membuang baris (kasus) yang mengandung misssing value,menghapus variabel(kolom) yang mengandung missing value
  • mengisi sel(data) yang missing dengan nilai tertentu yang dianggap bisa mendekati kenyataan sebenarnya jika data terisi.Cara mengisi data yang missing bisa bermacam-macam, dan yang populer adalah mengisi dengan rata-rata keseluruhan data.

Uji Data statistik Multivariat

Uji data pada statistik multivariat pada prinsipnya betujuan untuk memastikan bahwa metode multivariat itu bisa digunakan pada data tertentu sehingga hasil proses multivariat bisa diinterprestasi dengan cepat. Pengabaian uji data bisa berakibat biasnya kesimpulan yang diambil atau bahkan metode multivariat tidak bisa diproses.

Jenis pengujian data dalam multivariat adalah
  • Pengujian  adanya missing data.yakni menguji apakah data yang tidak lengkap/ ada data yang hilang akan mempengaruhi pengolahan data secara keseluruhan.
  • Pengujian adanya outliner (data yang sangat ekstrem) : pada banyak kasus,keberadaan data outliner akan mengganggu keseluruhan data,yang dapat mengakibatkan biasnya kesimpulan yang diambil.
  • Pengujian beberapa asumsi-asumsi metode-metode multivariat,seperti uji normalitas data,uji linieritas data dan sebagainya.
Sedangkan cara pengujian dapat dilakukan dengan cara:
  • menggunakan grafik,misalkan untuk menguji bentuk kenormalan,sebuah distribusi data,menguji sebaran dua variabel untuk korelasi dan sebagainya. Tampilan garfik cukup praktis dan memadai untuk menguji sejumlah data secara sekilas
  • Menggunakan alat uji statistik tertentu. Cara ini digunakan untuk tampilan grafik yang dianggap belum cukup,atau untuk melengkapi dan mempertajam hasil analisis


Sabtu, 27 Agustus 2011

Analisis Multivariat

Analisis multivariat/ metode multivariat berhubungan dengan metode-metode statistik yang secara bersama-sama(simultan) melakukan analisis terhadap lebih dari dua variabel pada setiap objek atau orang. Jadi, bisa dikatakan analisis multivariat merupakan perluasan dari analisis univariat (seperti uji t) atau bivariat (seperti korelasi dan regresi sederhana)

Analisis multivariat adalah analisis multi variabel dalam satu atau lebih hubungan. Analisis ini berhubungan dengan semua teknik statistik yang secara simultan menganalisis sejumlah pengukuran pada individu atau objek

Sebagai contoh,jika dilakukan analisis regresi sederhana,dengan satu variabel y dan satu variabel x, maka analisis seperti itu dikatakan bivariat, karena ada dua (bi) variabel,X dan Y.Sedang jika dilakukan analisis regresi berganda,dengan satu variabel y dan dua variabel X(X1 dan X2), maka analisis sudah bisa dikatakan multivariat,karena ada tiga variabel (termasuk X1 dan X2). Sedangkan variat bisa didefinisikan sebagai suatu kombinasi linier dari variabel- variabel dengan bobot variabel yang ditentukan secara empiris.

Yang paling terpenting dalam menentukan analisis multivariat apa yang dipakai harus diketahui jenis data manakah X1 dan X2 itu.

Sampling error (presisi) dan non sampling eror (bias)

Sampling error menunjukkan variasi nilai pengukuran antara satu sampel dengan sampel lainnya. Nilai variasi ini biasanya dinyatakan dalam suatu angka yang disebut dengan presisi. Sedangkan non sampling error atau disebut juga bias merupakan kesalahan yang terjadi pada proses pengukuran. Non sampling error bisa diakibatkan oleh beberapa hal, di antaranya bias alat, yaitu alat yang digunakan dalam proses pengukuran memberikan nilai kesalahan. Misalkan alat yang digunakan rusak, tidak layak pakai, dan sebagainya. Hal kedua adalah bias pengukur, yaitu kesalahan akibat si pengukur (human error), misalkan si pengukur salah membaca alat, salah mencatatdan sebagainya.

Sedangkan bias metodologi, yaitu kesalahan dalam menerapkan metodologi pengukuran, dalam hal ini metodologi yang digunakan dalam proses pengukuran tidak sesuai dengankarakter populasi yang akan diukur. Contoh bias metodologi adalah kesalahan dalam menerapkan teknik dan metode sampling.

Jika pusat lingkaran adalah nilai tengah populasi dan titik-titik adalah nilai pengamatan sampel, maka
pengukuran yang akurat adalah pada posisi sampling error yang rendah dan non sampling error yang rendah pula. Apabila masalah bias telah bisa diatasi dan bernilai nol, maka besarnya akurasi dapat diukur dengan nilai presisinya.

Semakin kecil nilai presisi  maka variasi nilai pengamatan antar-sampel semakin kecil (precise). Namun, semakin besar nilai presisi maka variasi pengamatan antarsampel semakin besar (unprecise). Jika ukuran sampel semakin besar, maka distribusi sampling menjadi semakin mendekati normal, apa pun distribusi populasinya. Jika nilai σ tidak diketahui, dan data populasi mengikuti sebaran normal, maka estimasi nilai populasi dapat didekati dengan nilai Confident Interval (CI)

Senin, 22 Agustus 2011

Analisis Paired - Samples T

Analisis Paired-Samples T Test merupakan prosedur yang digunakan untuk membandingkan
rata-rata dua variabel dalam satu group. Artinya pula analisis ini berguna untuk melakukan pengujian terhadap dua sampel yang berhubungan atau dua sampel berpasangan.

Prosedur Paired-Samples Uji T digunakan untuk menguji bahwa tidak ada perbedaan antara dua variabel. Data boleh terdiri atas dua pengukuran dengan subjek yang sama atau satu pengukuran dengan beberapa subjek.
Prosedur uji ini akan menghasilkan output sebagai berikut:
• Statistik deskriptif untuk masing-masing variabel yang diuji.
• Pearson korelasi antara masing-masing pasangan dan arti korelasinya.
• Suatu interval kepercayaan untuk rata-rata perbedaan (95%
atau suatu nilai tertentu yang ditetapkan).

Data Nominal dan Ordinal untuk statistik deskriptif

Salah satu ciri utama sehingga sebuah data ‘harus’ diproses dengan metode nonparametrik adalah jika tipe data tersebut semuanya adalah data nominal atau ordinal. Hal ini tidak berarti semua data nominal (seperti gender, kategori usia, kode pos, dan lainnya) atau data ordinal (sikap konsumen, pendapat masyarakat, dan lainnya) dipastikan akan diproses secara metode nonparametrik; jika data nominal atau ordinal tersebut ada dalam kesatuan dengan sejumlah data rasio, data nominal dapat berfungsi sebagai grup (faktor) dalam sejumlah metode parametrik, seperti uji F/Anova.

Walaupun sebuah data termasuk interval/rasio, namun jika jumlah data minim, misalkan sepuluh ke bawah, data tersebut sebaiknya diproses menggunakan metode nonparametrik, karena distribusi data sulit untuk memenuhi syarat normalitas sehingga hasil pengolahan dapat bias. Namun, jika sebuah data nominal/ordinal berdiri sendiri, atau akan diproses secara individu, maka metode statistik nonparametrik adalah metode yang
paling tepat. Pada statistik nonparametrik, mengikuti metode statistik parametrik, pengolahan data dapat dibagi menjadi dua, yakni statistik deskriptif dan statistik induktif.

Model dari analisis diskriminan

Analisis diskriminan termasuk dalam Multivariate Dependence Method, dengan model:
Y1        = X1+X2+…+Xn
Non      -  Metrik Metrik
Keterangan:
• Variabel Independen (X1 dan seterusnya) adalah data metrik, yakni data berjenis interval atau rasio, seperti Usia seseorang, tinggi sebuah pohon, kandungan zat besi dalam tubuh, dan sebagainya.

• Variabel Dependen (Y1) adalah Data Kategorikal atau Nominal, seperti Golongan Miskin (kode 1), Golongan Menengah (kode 2), Golongan Kaya (kode 3) dan sebagainya. Jika data kategorikal tersebut hanya terdiri atas dua kode saja (misal kode 1 untuk Daerah Banjir dan kode 2 Daerah Non-Banjir), maka model bisa disebut Two-Group Discriminant Analysis. Sedang jika kode lebih dari dua kategori, disebut dengan Multiple Discriminant Analysis.

• Dari keterangan di atas, perhatikan adanya perbedaan dalam penempatan data yang sekilas mirip. Seperti Usia seseorang (dalam tahun). Jika usia disebut secara langsung sekian tahun (17 tahun, 32 tahun dan sebagainya), maka data tersebut adalah rasio dan otomatis diperlakukan sebagai variabel independen. Namun, jika Usia seseorang dilakukan penggolongan, dan dimasukkan dalam kategori-kategori tertentu, seperti jika Usia seseorang antara 15-20 tahun, ia digolongkan Remaja, di atas 20 tahun digolongkan Dewasa, maka data orang yang berusia 17 tahun tidak akan ditulis langsung '17', namun akan ditulis Remaja. Data hasil kategorisasi ini adalah data nominal dan termasuk variabel Dependen. Dengan demikian, usia 17 tahun bisa menjadi variabel dependen atau independen tergantung bagaimana data tersebut akan diperlakukan, langsung diinput apa adanya atau dilakukan penggolongan.