รายละเอียดขั้นตอนงานวิจัย 4 ระยะ (PhD Research Work Plan)
เอกสารฉบับนี้กำหนดรายละเอียด ขั้นตอน กระบวนการทางเทคนิค และระเบียบวิธีวิจัย 4 ระยะหลักของโครงการ TaijiFlow AI สำหรับงานดุษฎีนิพนธ์ (PhD Dissertation) เพื่อพัฒนาระบบปัญญาประดิษฐ์ประเมินคุณภาพและให้คำแนะนำเชิงชีวกลศาสตร์สำหรับการฝึกมวยไทเก๊กสกุลเฉิน (Chen-style Taijiquan Silk Reeling) แบบ Client-Side Edge-Native 100%
แผนภาพรวมกระบวนการวิจัย 4 ระยะ (PhD Research Roadmap)
ระยะที่ 1: การสร้างชุดข้อมูลจลนศาสตร์ (Biomechanical Dataset Construction)
เป้าหมาย: สร้างชุดข้อมูลมาตรฐาน Taiji Silk Reeling Biomechanical Dataset ที่ประกอบด้วยอนุกรมเวลาพิกัด 3 มิติ (3D Spatial-Temporal Joint Coordinates) 33 จุด พร้อมฉลากกำกับคุณภาพเชิงชีวกลศาสตร์และจุดบกพร่องจากผู้เชี่ยวชาญหลายท่าน (Multi-Expert Ground Truth) ซึ่งมีความเที่ยงตรงทางสถิติสูง
ขั้นตอนย่อยและระเบียบวิธีปฏิบัติ
1) การกำหนดขอบเขตท่ารำและโครงสร้างชุดข้อมูล (Scope & Movements)
- กำหนดท่าฝึกมาตรฐานใน ชุดท่าม้วนไหม 12 ท่า (Chen-style Silk Reeling 12 Movements) ประกอบด้วย:
- ท่ามือเดี่ยว (Single Hand - 4 ท่า): ม้วนไหมมือเดียวตามเข็ม/ทวนเข็ม ซ้ายและขวา
- ท่าสองมือ (Double Hand - 4 ท่า): ม้วนไหมสองมือทิศทางเดียวกันและทิศตรงข้าม
- ท่าก้าวเท้าและมือเมฆ (Stepping & Cloud Hands - 4 ท่า): ก้าวข้าง, ก้าวเฉียง, ถอยหลัง, และมือเมฆ (Cloud Hands)
- นิยามกลุ่มระดับความชำนาญ:
- ระดับผู้เชี่ยวชาญ (Expert/Master Reference): บันทึกเพื่อใช้เป็นเกณฑ์แม่แบบความถูกต้องสูงสุด (Ground Truth Golden Standard)
- ระดับปานกลางและผู้ฝึกใหม่ (Intermediate & Novice Samples): บันทึกความหลากหลายของรูปแบบการเคลื่อนไหวและข้อผิดพลาดเชิงจลนศาสตร์ (Negative & Varied Examples)
2) โปรโตคอลการบันทึกข้อมูลคู่ขนาน (VIP Dual-Stream Capture Protocol)
- บันทึกข้อมูลด้วยระบบ [VIP Dual-Stream Capture](file:///Users/yut/TaijiFlow/research/phase-3/vip_dual_capture_complete_guide.md):
- Stream 1 (High-Speed Visual 60 FPS): วิดีโอ 2D ความละเอียด
ในสภาพแวดล้อมที่ควบคุมแสงและฉากหลัง สำหรับการตรวจประเมินซ้ำของผู้เชี่ยวชาญ - Stream 2 (Real-time Kinematic Stream): สกัดพิกัดข้อต่อ 33 จุด (
) แบบเฟรมต่อเฟรมผ่าน MediaPipe Pose
- Stream 1 (High-Speed Visual 60 FPS): วิดีโอ 2D ความละเอียด
- ควบคุมสภาพแวดล้อม: ระยะห่างกล้อง 2.5–3.0 เมตร, ระดับความสูงกล้องระดับกึ่งกลางลำตัว (Mid-torso height), ความเข้มแสง
3) ความเป็นส่วนตัวและจริยธรรมข้อมูล (Privacy-Preserving Obfuscation)
- ปฏิบัติตามมาตรฐานจริยธรรมการวิจัยในมนุษย์ (CMU REC):
- จัดเก็บเฉพาะไฟล์ตัวเลขพิกัดจลนศาสตร์นิรนาม (Anonymized Coordinate JSON) บนระบบฐานข้อมูลที่มี Row Level Security (Supabase RLS)
- ไม่มีการอัปโหลดหรือจัดเก็บไฟล์ภาพใบหน้า/วิดีโอดิบบนเซิร์ฟเวอร์คลาวด์สาธารณะ
4) การปรับมาตรฐานและการเตรียมข้อมูล (Preprocessing & Normalization Pipeline)
- Temporal Resampling (15 FPS Standardization): ทำการเกลี่ยข้อมูลอนุกรมเวลาด้วย Cubic Spline Interpolation ให้อยู่ที่ความถี่ 15 FPS คงที่ เพื่อแก้ปัญหา Variable Frame Rate (VFR) จากอุปกรณ์ต่างรุ่น
- T-Pose Scaling (Body Proportion Normalization): คำนวณระยะห่างระหว่างข้อต่อหลัก (ไหล่, กระดูกสันหลัง, สะโพก) ในช่วงเฟรมสอบเทียบ (Calibration Phase) เพื่อปรับสเกลขนาดร่างกายให้อยู่ในสัดส่วนมาตรฐานเดียวกัน
- Root Centering: ปรับจุดอ้างอิงพิกัด (
) ให้อยู่ที่กึ่งกลางสะโพก (Mid-Hip Joint) เพื่อขจัดอิทธิพลจากการเคลื่อนตัวเข้าใกล้/ออกห่างกล้อง
5) เกณฑ์การประเมินและการตรวจสอบความเที่ยงตรง (Multi-Expert Annotation & Validation)
- พัฒนาระบบเว็บแอปพลิเคชันสำหรับผู้เชี่ยวชาญ 3 ท่าน (ประสบการณ์สายตรง
ปี) ให้คะแนนอิสระแบบ Single-blinded: - คะแนนเชิงปริมาณ (Continuous AQA Score 0–5 หรือ 0–100): ประเมินด้าน ความต่อเนื่อง (Continuity), เสถียรภาพแกนกลาง (Stability), และ ลำดับการส่งแรง (Kinematic Chain)
- ฉลากข้อผิดพลาดเชิงสัญลักษณ์ (Discrete Error Tags): ระบุตำแหน่งและประเภทความผิดพลาด (เช่น "เข่าล้ำปลายเท้า", "ไหล่ยกเกร็ง", "เอวไม่นำแขน")
- เกณฑ์คัดกรองความเที่ยงตรงทางสถิติ:
- คำนวณค่า Intraclass Correlation Coefficient (
) สำหรับคะแนนตัวเลข - คำนวณค่า Fleiss' Kappa (
) สำหรับการติดฉลากจุดผิดพลาด - ข้อมูลเซสชันที่ไม่ผ่านเกณฑ์ความสอดคล้องจะถูกส่งกลับเพื่อพิจารณาร่วมกันหรือตัดออกจาก Dataset หลัก
- คำนวณค่า Intraclass Correlation Coefficient (
ระยะที่ 2: สถาปัตยกรรมโครงข่ายประสาทแบบไฮบริด (Hybrid DL Development)
เป้าหมาย: ออกแบบ ฝึกสอน และบีบอัดโมเดลเชิงลึก 2 ระดับ (Two-Tier Edge-Native Model Architecture) ให้สามารถรันบนเว็บเบราว์เซอร์ของผู้ใช้ได้ 100% ผ่านเทคโนโลยี WebGPU โดยไม่ต้องพึ่งพาเซิร์ฟเวอร์ GPU ภายนอก (Zero-Server Architecture)
สถาปัตยกรรมโมเดลเชิงลึก (Deep Learning Architecture Details)
ขั้นตอนย่อยและระเบียบวิธีปฏิบัติ
1) Tier 1: Real-time Edge Action Classifier (< 1 MB)
- พัฒนาโมเดลจำแนกท่ารำขนาดเบาพิเศษ (Lightweight ST-GCN / Temporal MLP)
- รับข้อมูลแบบ Sliding Window ขนาด 1.5–2.0 วินาที (Inference ทุกๆ 0.5 วินาที)
- ทำนายและสลับชุดกฎประเมินชีวกลศาสตร์ (12 Heuristics) ให้ตรงกับท่าที่ผู้ใช้กำลังรำโดยอัตโนมัติ (Zero-configuration Practice)
2) Tier 2: Sequence-based Action Quality Assessment (ST-GCN + Transformer)
- ST-GCN Encoder (Spatial Processing): โครงสร้างกราฟที่กำหนดข้อต่อ (Nodes = 33 Joints) และกระดูก (Edges = Anatomical Bones) เรียนรู้ความสัมพันธ์เชิงสรีรวิทยาในแต่ละเฟรม
- Temporal Transformer Decoder (Temporal Processing): ใช้กลไก Multi-Head Self-Attention ในการจับความสัมพันธ์ระยะยาว (Long-range Dependencies) ตลอดทั้งรอบการเคลื่อนไหว (Kinematic Flow)
- Multi-Task Loss Function:
3) การบีบอัดและติดตั้งบน Edge (Pruning, Quantization & WebGPU Deployment)
- ทำ Structural Graph Pruning และ INT8 / FP16 Quantization ลดขนาดโมเดลรวมเหลือไม่เกิน 5–10 MB
- ส่งออกเป็นฟอร์แมต ONNX และประมวลผลผ่าน ONNX Runtime Web (ORT-Web) บนเบราว์เซอร์:
- Primary Backend: WebGPU API สำหรับการประมวลผลความเร็วสูงบนฮาร์ดแวร์ของผู้ใช้
- Fallback Backend: WebAssembly (Wasm) + SIMD สำหรับอุปกรณ์ที่ไม่รองรับ WebGPU
4) การศึกษาเปรียบเทียบและการทดสอบเชิงเทคนิค (Ablation & Baseline Study)
- เปรียบเทียบประสิทธิภาพกับโมเดลพื้นฐาน: ST-GCN เดี่ยว, Pure LSTM/Transformer, และ Rule-based Heuristics เดิม
- ประเมินค่าความแม่นยำ (Accuracy, F1-Score), ค่าความสัมพันธ์ของคะแนน (Spearman's
, Pearson's ), และอัตราเฟรมเรต ( บนแล็ปท็อปทั่วไป)
ระยะที่ 3: ระบบ Neuro-Symbolic XAI และ Feedback Engine
เป้าหมาย: แปลงผลการวิเคราะห์จากโครงข่ายประสาทเทียมให้กลายเป็น คำอธิบายเชิงชีวกลศาสตร์ที่โปร่งใสและคำแนะนำการสอนที่เข้าใจง่าย (Pedagogical Feedback) โดยผสานตรรกะเชิงสัญลักษณ์เข้ากับ Attention Weights จากโมเดล
ขั้นตอนย่อยและระเบียบวิธีปฏิบัติ
1) การสกัดและการทำแผนที่ความสนใจ (Spatio-Temporal Attention Mapping)
- ดึง Attention Matrix จาก Temporal Transformer Layer เพื่อระบุ:
- มิติเวลา (Temporal Dimension): เสี้ยววินาทีหรือจังหวะของท่ารำที่โมเดลให้น้ำหนักความสำคัญหรือพบความผิดปกติสูงสุด
- มิติข้อต่อ (Spatial/Joint Dimension): ข้อต่อร่างกายที่เป็นสาเหตุหลักของคะแนน (เช่น ข้อเข่าบิด, ไหล่เกร็ง, สะโพกไม่ยุบตัว)
- สร้าง Attention Heatmap แสดงทับบนโครงกระดูก 3 มิติ (3D Skeleton Overlay) เพื่อให้เห็นจุดที่ระบบโฟกัสอย่างชัดเจน
2) อัลกอริทึมตรวจจับการส่งแรง (Kinematic Phase Shift Detection)
- พัฒนาฟังก์ชันคำนวณ Angular Phase Delay: ตรวจจับความหน่วงเวลาระหว่างมุมการหมุนของข้อต่อแกนล่าง (เอว/สะโพก) กับแกนบน (มือ/ข้อมือ)
- ตรวจสอบหลักการพื้นฐานของมวยไทเก๊ก: "เอวเป็นแกนนำ ลำตัวส่งแรง แขนหมุนตาม (Waist leads the movement)" หากมือเริ่มขยับก่อนเอว ระบบจะระบุข้อผิดพลาด "เคลื่อนไหวมือลอย ไม่ใช้แรงจากแกนกลาง"
3) ตรรกะประเมินกฎชีวกลศาสตร์ 12 ข้อ (12 Biomechanical Heuristics Integration)
- ผสานรวม [คู่มือกฎ AI ชีวกลศาสตร์ 12 ข้อ](file:///Users/yut/TaijiFlow/research/phase-3/heuristics/heuristics_rules_12_detail.md) ครอบคลุม:
- การจัดแนวดิ่งของกระดูกสันหลังและศีรษะ (Head Suspension & Spine Alignment)
- แนวป้องกันเข่าล้ำปลายเท้าและการเปิดมุมขาหนีบ (Knee Over Toe & Kua Opening)
- ความต่อเนื่องของรัศมีวงกลมแขนและการหย่อนไหล่ศอก (Shoulder Sinking & Elbow Dropping)
- เสถียรภาพจุดศูนย์ถ่วงและการถ่ายน้ำหนักแยกหนักเบา (Yin-Yang Weight Shifting)
4) กลไกสร้างภาษาและคำแนะนำการสอน (Deterministic Template NLP Engine)
- ใช้ Deterministic Structured Template NLP แบบออฟไลน์ (ไม่ใช้ Cloud LLM เพื่อป้องกัน Hallucination และทำงานได้โดยไร้ต้นทุน API):
- แปลงพารามิเตอร์เชิงตัวเลขเป็นประโยคแนะนำเชิงบวก (Actionable Pedagogical Advice)
- เช่น "ช่วงวินาทีที่ 1.2–1.8 การหมุนเอวยังนำไม่ชัดเจน ให้ลองหมุนสะโพกขวาก่อนส่งแรงออกสู่ฝ่ามือ"
- เชื่อมต่อกับ Web Speech API เพื่อส่งเสียงเตือนสั้นๆ ทันทีขณะกำลังรำ (Real-time Latency
)
ระยะที่ 4: การทดสอบและการประเมินผล (Testing & RCT Protocol)
เป้าหมาย: ดำเนินการทดลองทางคลินิกแบบสุ่มและมีกลุ่มควบคุมระยะยาว 8 สัปดาห์ (Longitudinal Randomized Controlled Trial - RCT) เพื่อพิสูจน์ประสิทธิผลของระบบ TaijiFlow AI ต่อพัฒนาการจลนศาสตร์การทรงตัวและการยอมรับของผู้ใช้งานจริง
ขั้นตอนย่อยและระเบียบวิธีปฏิบัติ
1) การออกแบบการทดลองและจริยธรรมการวิจัย (Study Design & Ethics)
- รูปแบบการวิจัย: Single-blinded Interface-Equivalent Longitudinal RCT ระยะเวลา 8 สัปดาห์
- ผ่านการรับรองจริยธรรมการวิจัยในมนุษย์จากคณะกรรมการจริยธรรม มหาวิทยาลัยเชียงใหม่ (CMU REC)
- กลุ่มตัวอย่าง: อาสาสมัครสุขภาพดี อายุ 18–59 ปี จำนวน
คน แบ่งออกเป็น: - กลุ่มทดลอง (Active AI Group,
): ใช้งานระบบที่แสดงผล Real-time Heuristic Alerts, 3D Skeleton และรายงาน Neuro-Symbolic XAI เต็มรูปแบบ - กลุ่มควบคุม (Sham UI / Placebo Group,
): ใช้งานหน้าจอแอปพลิเคชันที่มีโครงสร้างเหมือนกันทุกประการ แต่ปิดการแสดงผล Skeleton และคำเตือน AI (Silent Data Collection เพื่อตัดตัวแปรแทรกซ้อนด้าน Interface Effect)
- กลุ่มทดลอง (Active AI Group,
2) โปรโตคอลการฝึกซ้อมและควบคุมปริมาณ (Training Protocol & Compliance)
- กำหนดความถี่: ฝึกซ้อม สัปดาห์ละ 3 วัน (วันเว้นวัน เช่น จันทร์/พุธ/ศุกร์)
- ระยะเวลา: วันละ 1 เซสชัน รำครบทั้ง 12 ท่า ท่าละ 3 นาที (เวลาฝึกสุทธิ 36 นาที/วัน)
- ระบบบันทึกอัตโนมัติ (Automated Compliance Tracking): จัดเก็บเวลาล็อกอิน, ระยะเวลาซ้อมจริง, และจำนวนรอบขึ้นระบบ Supabase เพื่อควบคุมความเที่ยงตรง
3) เครื่องมือวัดผลและการประเมินสมรรถภาพ (Outcome Measures)
- การทดสอบสมรรถภาพทางกายภาพหลัก (Primary Physical Outcome):
- แบบทดสอบการทรงตัวขาเดียวแบบลืมตา (One-leg Balance Test - Eyes Open): ทดสอบในห้องปฏิบัติการควบคุม 3 รอบต่อขา (ซ้ายและขวา) บันทึกระยะเวลาที่ทรงตัวได้นิ่ง เพื่อวัดพัฒนาการด้าน Motor Learning & Static Balance
- การประเมินคุณภาพชีวกลศาสตร์ (Secondary Biomechanical Outcome):
- เปรียบเทียบคะแนน AQA Score และค่าความคลาดเคลื่อนของมุมข้อต่อ (Joint Kinematic Errors) ระหว่างสัปดาห์ที่ 0, 4, และ 8
- การประเมินการยอมรับและประสบการณ์ผู้ใช้ (Usability & User Perception):
- System Usability Scale (SUS): วัดความง่ายและประสิทธิภาพในการใช้งานระบบ
- Continuous Scale of Instrument Usability (CSI): ประเมินความพึงพอใจต่อเครื่องมือ
- AI Trust & Pedagogical Clarity Questionnaire: วัดความเชื่อมั่นในคำแนะนำของ AI และความเข้าใจต่อข้อผิดพลาดของตนเอง
4) การวิเคราะห์ข้อมูลทางสถิติ (Statistical Analysis Plan)
- วิเคราะห์ความแตกต่างระหว่างกลุ่มและปฏิสัมพันธ์ของเวลาด้วย Repeated Measures ANOVA (RM-ANOVA) หรือ Linear Mixed Models (LMM)
- คำนวณขนาดอิทธิพล (Effect Size: Cohen's
หรือ Partial ) เพื่อยืนยันนัยสำคัญเชิงปฏิบัติ (Practical Significance) นอกเหนือจากนัยสำคัญทางสถิติ ( )
คุณูปการสำคัญของดุษฎีนิพนธ์ (PhD Dissertation Contributions)
- ด้านชีวกลศาสตร์และการสอน (Biomechanical & Domain Pedagogy):
- แปลงศาสตร์การเคลื่อนไหวไทเก๊กสกุลเฉินสู่กฎเชิงคณิตศาสตร์และชีวกลศาสตร์ 12 ข้อที่เป็นรูปธรรม
- สร้างชุดข้อมูลมาตรฐาน Taiji Silk Reeling Dataset ที่มี Inter-rater Reliability สูง (
)
- ด้านวิทยาการคอมพิวเตอร์และปัญญาประดิษฐ์ (Computer Science & Edge AI):
- คิดค้นสถาปัตยกรรม Two-Tier Neuro-Symbolic AQA ที่ประมวลผลบน Client-Side ผ่าน WebGPU แบบ 100% Zero-Server และเคารพความเป็นส่วนตัวของผู้ใช้ (Privacy-Preserving)
- พัฒนากลไก XAI ที่แปลง Attention Weights ร่วมกับ Heuristics สู่คำแนะนำเชิงการสอนที่ปราศจากข้อผิดพลาด (Zero-Hallucination Template NLP)
- ด้านการศึกษาในมนุษย์และปฏิสัมพันธ์ระหว่างมนุษย์กับคอมพิวเตอร์ (Clinical RCT & HCI):
- พิสูจน์ประสิทธิผลของระบบผ่านการทดลองแบบ Longitudinal Single-blinded RCT 8 สัปดาห์ ร่วมกับกลุ่ม Placebo Sham UI ที่ได้มาตรฐานการวิจัยระดับสากล