# AI đánh giá một công ty phần mềm dựa vào đâu

> NC-01 · AI và GEO · Bản 1.0Trợ lý AI chấm một công ty phần mềm chủ yếu qua việc số trên trang có định nghĩa hay không, bằng chứng nằm trên domain nào và pháp

URL: https://mona.software/nghien-cuu/ai-danh-gia-cong-ty-phan-mem/
Cập nhật: 2026-09-28T17:04:22+07:00

NC-01 · AI và GEO · Bản 1.0

Trợ lý AI chấm một công ty phần mềm chủ yếu qua việc số trên trang có định nghĩa hay không, bằng chứng nằm trên domain nào và pháp nhân có rõ không. MONA hỏi Codex và Claude cùng 16 câu về chính mona.software qua ba vòng sửa trang: điểm tin cậy tăng từ 4,77 lên 5,50 trên 10, còn câu trả lời khi AI tự tìm web thì gần như không đổi.

Thực hiện: Nhóm kỹ thuật MONA Software, Công ty TNHH Phần mềm MONA, MST 0316694442. Công bố 28/09/2026, đo 25/09 và 28/09/2026, cập nhật 28/09/2026.

 

## 1. Kết luận cho chủ doanh nghiệp

 - Trợ lý AI chấm nhà cung cấp phần mềm qua bằng chứng đọc được: con số có định nghĩa, case nằm trên chính domain của công ty, pháp nhân ghi rõ.

- Sửa lại chữ đang có trên trang đủ đổi điểm: sau hai đợt sửa, điểm tin cậy Codex và Claude chấm cho mona.software tăng từ 4,77 lên 5,50 trên 10.

- Khi AI tự tìm web mà không được đưa trang, câu trả lời gần như không đổi, nên bài viết và hồ sơ bên ngoài phải sửa cùng lúc với website.

- Doanh nghiệp nhờ AI chọn nhà cung cấp nên đưa AI đọc trang case cụ thể và hỏi từng con số đo thế nào, thay vì hỏi công ty nào tốt.

 Số chính: Điểm tin cậy 4,77 → 5,50 trên 10: trung bình điểm Codex và Claude tự chấm, 32 câu trả lời mỗi vòng, vòng 1 đến vòng 3.

 

## 2. MONA hỏi AI những gì về mona.software, và vì sao đo trên chính site mình

 MONA hỏi ba mô hình AI cùng 16 câu về mona.software, mỗi câu đóng vai một người đang đi tìm nhà cung cấp phần mềm, rồi so điểm qua ba lần sửa trang. Đo trên chính site của mình thì MONA biết chính xác trang đã đổi gì giữa hai vòng, nên thay đổi của điểm gắn được với từng lần sửa.

 

### 12 câu kèm nội dung trang
- CTO chọn đơn vị viết ERP
- Phòng mua hàng lập shortlist
- Bên mua Nhật Bản
- Agency Singapore, Úc
- Startup cần MVP
- Nhà đầu tư
- Sales công ty đối thủ
- Nhà báo công nghệ
- Kiểm toán portfolio
- Kiểm số liệu
- Phê bình thẳng (roast)
- Pháp chế, bảo mật ngân hàng

 

### 4 câu hỏi lạnh, AI tự tìm web
- top công ty phần mềm Việt Nam
- MONA có đáng tin
- có thật là công ty phần mềm
- shortlist ERP cho nhà máy

 Câu hỏi nguyên văn nằm trong cau-hoi.md.

Tải cau-hoi.md 

 Bảng 0. Ba vòng hỏi, đầu vào và số câu trả lời
 VòngNgàyĐầu vào của câu kèm trangCâu trả lời

 Vòng 125/09/2026Chữ và JSON-LD trang chủ47 (16 Codex, 16 Claude, 15 GPT-5.5)

Vòng 225/09/2026Trang chủ đã sửa, 6 trang case phần mềm /du-an/… và llms.txt38 (16 Codex, 16 Claude, 6 GPT-5.5)

Vòng 328/09/2026Cùng bộ trang như vòng 2, lấy lại ngày 28/0932 (16 Codex, 16 Claude, 0 GPT-5.5)

 

## 3. Điểm AI chấm qua ba vòng sửa trang

 Điểm tin cậy đi ngang ở vòng 2 (4,77 → 4,68) rồi tăng lên 5,50 ở vòng 3. Vòng 3 là lần đầu cả Codex và Claude cùng tăng ở cả bốn tiêu chí.

 Hình 1. Điểm tăng ở cả bốn tiêu chí sau vòng 3

 Bảng 1. Điểm trung bình ghép cặp Codex và Claude, thang 0 đến 10 (số câu có điểm trong ngoặc)Tiêu chíVòng 1 · 25/09Vòng 2 · 25/09Vòng 3 · 28/09

Độ tin cậy4,77 (28)4,68 (28)5,50 (28)

Sức mạnh portfolio4,73 (28)4,73 (28)5,07 (28)

Có thật là công ty phần mềm6,28 (25)6,52 (26)6,84 (25)

Sẵn sàng cho doanh nghiệp lớn3,04 (24)3,20 (25)3,67 (24)

 Ghi chú: trung bình ghép cặp, tức 32 câu trả lời của Codex và Claude mỗi vòng (16 + 16), trong tổng số 47, 38, 32 câu trả lời của ba vòng. Số câu có điểm ở từng tiêu chí là 24 đến 28, ghi trong ngoặc ở bảng số. Thang 0 đến 10. Đề bài yêu cầu phê bình gay gắt, nên chỉ so các vòng với nhau.

 Nguồn: MONA Software, NC-01, diem-2026-09-28.csv

 Hai mô hình chấm khác nhau khá xa trên cùng đầu vào, nên bài so từng mô hình với chính nó qua các vòng. Codex chấm cao hơn Claude ở cả bốn tiêu chí và cả ba vòng.

 Bảng 2. Điểm trung bình theo từng mô hình, thang 0 đến 10 (số câu có điểm trong ngoặc)Vòng, mô hìnhĐộ tin cậyPortfolioCông ty phần mềm thậtDoanh nghiệp lớn

Vòng 1 · Codex5,18 (14)5,54 (14)7,50 (12)3,75 (12)

Vòng 1 · Claude4,36 (14)3,93 (14)5,15 (13)2,33 (12)

Vòng 2 · Codex5,25 (14)5,93 (14)7,85 (13)4,08 (13)

Vòng 2 · Claude4,11 (14)3,54 (14)5,19 (13)2,25 (12)

Vòng 3 · Codex6,07 (14)6,46 (14)8,00 (13)4,50 (12)

Vòng 3 · Claude4,93 (14)3,68 (14)5,58 (12)2,83 (12)

 GPT-5.5 không tìm web có 15, 6, 0 câu trả lời ở ba vòng do cổng lỗi, nên có trong file điểm nhưng không đưa vào so sánh.

 

## 4. AI bắt lỗi gì trên trang của một công ty phần mềm

 AI bắt nhiều nhất ở những con số không có định nghĩa và những chỗ chữ trên trang nói khác nhau. Sáu phát hiện dưới đây đánh số F1 đến F6, mỗi phát hiện có link riêng để trích.

 - F1. Sửa chữ đang có trên trang đủ đổi điểm. Điểm tin cậy ghép cặp đi từ 4,77 ở vòng 1 xuống 4,68 ở vòng 2 rồi lên 5,50 ở vòng 3. Vòng 3 là vòng đầu tiên cả Codex và Claude cùng tăng ở cả bốn tiêu chí so với vòng trước.

- F2. AI hỏi nguồn và cách đo của con số ở phần lớn câu trả lời. Số câu trả lời nhắc tới số liệu thiếu nguồn, thiếu cách đo hoặc chưa kiểm chứng là 38/47 ở vòng 1, 25/38 ở vòng 2 và 24/32 ở vòng 3. Con số không kèm mẫu số, ngày tính và cách đo là thứ AI hỏi lại đầu tiên.

- F3. Gỡ một con số không có cách đếm thì lời chê về nó hết ngay vòng sau. Một con số trên trang chủ không có cách đếm được nhắc ở 29/47 câu vòng 1; sau khi gỡ, vòng 2 còn 0/38 và vòng 3 còn 0/32. Một cụm từ tuyệt đối về bảo mật đi từ 16/47 xuống 0/38 câu.

- F4. Mỗi con số trên trang case cần cỡ mẫu và ngày của riêng nó. Một khối chỉ số khảo sát chưa ghi cỡ mẫu được nhắc ở 27/38 câu vòng 2. Ở vòng 3, khi các trang case chỉ giữ số có định nghĩa riêng, còn 1/32 câu.

- F5. AI đọc cả chữ người xem không thấy. Đầu vào vòng 3 dài 99.238 ký tự, trong đó con số 14.000 xuất hiện 32 lần, 28 lần là cùng một dòng menu in lại ở mỗi tab. Chữ mặc định của hiệu ứng tải trang, hiện trước khi JavaScript đếm số, được nhắc ở 6/32 câu vòng 3.

- F6. Câu hỏi lạnh gần như không đổi, và hai mô hình chấm lệch nhau. Với 4 câu hỏi lạnh, điểm tin cậy ghép cặp là 6,13 → 6,13 → 6,50 (4 câu có điểm mỗi vòng). Trên cùng đầu vào vòng 3, Codex cho độ tin cậy 6,07 còn Claude cho 4,93.

 Hình 2. Lời chê về một con số hết hẳn ở vòng ngay sau khi sửa

 Bảng 3. Số câu trả lời nhắc tới từng lời chê trên tổng số câu trả lời của vòngLời chêVòng 1 · 25/09Vòng 2 · 25/09Vòng 3 · 28/09

Con số không có cách đếm29/470/380/32

Cụm từ tuyệt đối về bảo mật16/470/380/32

Chỉ số khảo sát chưa ghi cỡ mẫu2/4727/381/32

 Ghi chú: tất cả câu trả lời của từng vòng (47, 38, 32), đếm câu có chứa mẫu tìm ghi trong cau-hoi.md. Cả ba chỗ được sửa trên trang giữa hai vòng liền nhau.

 Nguồn: MONA Software, NC-01, cau-hoi.md (mục Cách đếm)

 

## 5. AI đọc HTML, JSON-LD và llms.txt ra sao

 Trợ lý AI đọc HTML trước khi JavaScript chạy, đọc JSON-LD như lời công ty tự khai và đọc llms.txt như bản tóm tắt chính thức. Chỗ nào ba lớp này nói khác chữ người xem thấy, AI ghi thành điểm trừ.

 Bảng 4. Chỗ AI đọc khác người xem và cách MONA đã sửa trên mona.software
 Chỗ AI đọc khác người xemVì sao thành điểm trừCách sửa

 Chữ mặc định của hiệu ứng tải trang, ví dụ số 0 trước khi JavaScript đếm lênCông cụ lấy trang đọc HTML trước khi JavaScript chạyIn giá trị cuối trong HTML, JavaScript chỉ chạy hiệu ứng đếm

Một dòng menu lặp ở nhiều tab trong DOMAI đếm mỗi lần lặp như một lần nhấn mạnhMột dòng dùng chung, đặt ngoài các tab

JSON-LD gán số liệu của cả tập đoàn cho một pháp nhânAI coi đó là số của pháp nhân ký hợp đồngChỉ giữ trường đúng với pháp nhân, số cả tập đoàn ghi rõ trong chữ

URL nhúng video trong JSON-LD có tham số theo dõiAI đọc thành dấu hiệu dữ liệu chưa được ràLàm sạch embedUrl

File llms-full.txt tự gom trang cũ chưa rà sốAI đọc số cũ như số hiện hànhChặn file tự gom, viết llms.txt bằng tay

Tổng người dùng đứng cạnh số người dùng cùng lúcAI so hai số khác loại và coi là mâu thuẫnTách "thiết kế cho" và "đo khi chạy thật", ghi đơn vị của từng số

 

## 6. Doanh nghiệp nhờ AI tìm nhà cung cấp nên hỏi thế nào

 Doanh nghiệp nhờ AI lập danh sách nhà cung cấp nên đưa AI đúng trang cần đọc và hỏi từng con số, vì câu hỏi chung chung chỉ cho lại câu trả lời chung chung.

 - Đưa AI đọc trang case cụ thể của nhà cung cấp, không chỉ trang chủ.
- Hỏi từng con số: là tổng hay số cùng lúc, đo ngày nào, bằng công cụ gì.
- Hỏi pháp nhân ký hợp đồng, mã số thuế và ngày thành lập của pháp nhân đó.
- Hỏi cùng một câu ở hai mô hình khác nhau rồi so hai câu trả lời.
- Mở lại nguồn mà AI trích trước khi tin một kết luận.

 Sáu trang case phần mềm MONA đưa vào đầu vào vòng 2 và 3:

 - The IELTS Workshop
- PWEV by L'Oréal
- Ngọc Thành Jewelry
- Bệnh viện Hoàn Mỹ Sài Gòn
- Polytex Far Eastern Việt Nam
- Khoa Y, Đại học Y Dược TP.HCM

 

## 7. Phương pháp và dữ liệu
117 câu trả lời
 Phương pháp đoCâu hỏi16 câu cố định, giữ nguyên chữ qua ba vòng: 12 câu kèm nội dung trang, mỗi câu một vai người hỏi, và 4 câu hỏi lạnh không đưa trang.

Yêu cầu chungPhê bình gay gắt, trích nguyên văn nội dung được đưa, chấm 0 đến 10 cho bốn tiêu chí.

Mô hìnhCodex CLI (GPT, câu lạnh có tìm web), Claude CLI (câu lạnh có tìm web), GPT-5.5 qua cổng nội bộ (không tìm web).

Đầu vàoVòng 1: chữ và JSON-LD trang chủ. Vòng 2: thêm 6 trang case phần mềm và llms.txt. Vòng 3: cùng bộ trang, lấy lại ngày 28/09.

Cách chấmĐiểm do chính mô hình trả lời tự cho. score_round.py dùng Claude CLI, không kèm công cụ, đọc lại từng câu trả lời và trích điểm ra JSON; câu không chấm thì để trống.

Cỡ mẫu117 câu trả lời (47 + 38 + 32). So sánh ba vòng dùng 96 câu của Codex và Claude, 32 câu mỗi vòng; 24 đến 28 câu có điểm ở mỗi tiêu chí.

Phát hiệnF1 và F6 tính từ file điểm. F2 đến F5 đếm câu trả lời có chứa mẫu tìm ghi trong cau-hoi.md.

Thời gian25/09/2026 (vòng 1 và 2), 28/09/2026 (vòng 3).

 File dữ liệu

 - diem-2026-09-28.csvđiểm từng câu trả lời
- cau-hoi.mdcâu hỏi nguyên văn, cách hỏi, cách đếm
- tinh_bang.pytính lại Bảng 1 và Bảng 2 từ file điểm
- score_round.pyđọc câu trả lời, trích điểm ra JSON

 Chạy lại: python3 tinh_bang.py diem-2026-09-28.csv

 Câu trả lời nguyên văn: công bố sau

 

## 8. Giới hạn của phép đo

 - 16 câu hỏi, mỗi câu chạy một lần mỗi vòng, nên chưa đo độ dao động khi hỏi lại cùng một câu.
- Đề bài yêu cầu phê bình gay gắt, nên điểm tuyệt đối thấp hơn cách hỏi thường; bài chỉ so các vòng với nhau.
- Điểm do Claude trích từ câu trả lời, trong đó có câu trả lời của chính Claude, nên có thể lệch theo cách Claude đọc.
- GPT-5.5 lỗi cổng (15, 6, 0 câu qua ba vòng) và Gemini chưa chạy được, nên so sánh chỉ còn hai mô hình.
- Câu hỏi lạnh phụ thuộc kết quả tìm web của ngày chạy, và mỗi vòng chỉ có 4 câu lạnh có điểm tin cậy.
- Phát hiện F2 đến F5 đếm bằng mẫu tìm chữ, nên câu nói cùng ý bằng chữ khác không được đếm.
- MONA đo trên chính site của mình. File điểm, câu hỏi và mã tính lại được công bố; câu trả lời nguyên văn công bố sau.

 

## 9. Nhật ký phiên bản và trích dẫn

 Nhật ký phiên bản
 BảnNgàyThay đổiFile dữ liệu

 1.028/09/2026Vòng 3, tính lại điểm ghép cặp, công bố bàidiem-2026-09-28.csv

0.225/09/2026Vòng 2, thêm 6 trang case và llms.txt vào đầu vàotrong diem-2026-09-28.csv, cột vong = 2

0.125/09/2026Vòng 1, trang chủ và JSON-LDtrong diem-2026-09-28.csv, cột vong = 1

 Trích dẫn bài này

 Nhóm kỹ thuật MONA Software (2026). AI đánh giá một công ty phần mềm dựa vào đâu. NC-01, bản 1.0. Công ty TNHH Phần mềm MONA. https://mona.software/nghien-cuu/ai-danh-gia-cong-ty-phan-mem/. Đo 25/09–28/09/2026, cập nhật 28/09/2026.

 Dùng lại số liệu

 Dùng lại bảng và biểu đồ, ghi nguồn: MONA Software, NC-01. File điểm dùng theo giấy phép CC BY 4.0.

 Tải diem-2026-09-28.csv Bản Markdown Giấy phép CC BY 4.0
