Liên quan tới việc tra cứu mst tôi thấy nhiều cái tào lao và hề quá, người nào rành vô tình vào đây đọc thì @@...
1. Lấy text 1 loại hình đó thì dữ liệu đã huấn luyện (model) để giải nó bé tẹo thôi.
Model của tôi cỡ 700KB cho kết quả chuẩn chỉ luôn và ngay mà vẫn thấy chưa đạt yêu cầu rồi, làm gì mà tới mấy MB lận
Cái này quan trọng là khâu kỹ thuật phân tích hình ảnh và logic xử lý gắp từng ký tự ra ấy.
Từ đó code để huấn luyện tạo model và hàm giải. Đã muốn huấn luyện xyz thì tự làm hết từ đầu.
Nói chung là đọc thấy quá hài. Chịu khó tìm hiểu thêm đi đã.
2. Nào là cân bằng tải, phân luồng... =]]]
Cái đó là tối thiểu của một hệ thống mà, người ta còn phải thiết kế hệ thống đảm bảo nhiều requests đồng thời (cỡ vài ngàn, vài triệu) tới hệ thống vẫn chạy được ấy chứ. Rồi redis như thế nào để nhiều người vào dùng vẫn thấy mượt mà, tức thời.
Nhưng quả session bị lệch nhau thì thua. Khó thế mà cũng nghĩ ra được.

Không có lỗi (bug) đó đâu nhé. Tào lao thật sự.
3. Rồi thì chia files để chạy đồng thời cho nhanh, cái này nhảm quá luôn.
Request gửi từ 1 IP thì phải xếp hàng nhé, chạm vào rate limit thì block luôn nhé.
Chẳng qua code chạy chậm quá, nhiều files chạy cùng lúc nhưng mà vẫn chưa chạm nổi tới rate limit.

Không tin thì mở trình duyệt web lên rồi click chuột qua lại giữa 2 tabs xem, đúng 3 clicks là "Too Many Requests"
Túm lại là phải xếp hàng lần lượt, không đồng thời, không song song đa luồng gì nhé.
4. Hệ thống của họ không có vấn đề gì cả.
Quan trọng là trình độ phân tích hệ thống tra cứu đó, kỹ thuật xử lý như thế nào thôi.
Tìm ra bí thuật xịn là tra cứu không trượt phát nào nhé.
----
p/s: Tiết mục chạy KPI kéo traffic cho web diễn đàn lên nhé.