Giải mã các ‘dấu vết’ đặc trưng trong văn phong của AI: Khi nào máy móc lộ diện?
Nghiên cứu mới từ Graphite chỉ ra rằng dù các mô hình AI đã cải thiện đáng kể, chúng vẫn để lại những 'dấu vết' ngôn ngữ đặc trưng giúp người dùng dễ dàng nhận diện nội dung do máy tạo...
- Giọng nữ Bắc
Khi nội dung do LLM (Large Language Model) tạo ra xuất hiện tràn lan, nhu cầu nhận diện văn bản từ AI ngày càng trở nên cấp thiết. Dù những dấu hiệu cũ như việc lạm dụng dấu gạch ngang (em-dashes) hay từ ngữ lạ như “delve” đã dần biến mất, các nhà nghiên cứu khẳng định AI vẫn tồn tại những thói quen ngôn ngữ khó bỏ.
Một nghiên cứu từ công ty tiếp thị Graphite đã phân tích thói quen viết của các mô hình AI tiên tiến nhất hiện nay. Kết quả cho thấy có tới 13.000 cụm từ xuất hiện với tần suất cao gấp đôi so với văn bản do con người viết. Greg Druck, Giám đốc AI tại Graphite, nhận định rằng trong khi các mô hình Claude đang dần tiệm cận với phân bổ từ ngữ tự nhiên của con người, thì các mô hình GPT lại có xu hướng đi ngược lại.
Những “dấu vết” đặc trưng của từng mô hình
Mỗi mô hình AI sở hữu những “tật” viết lách riêng biệt:
- Claude Opus 5.5: Từ “dependable” (đáng tin cậy) xuất hiện nhiều gấp 23 lần so với văn bản người viết. Đặc biệt, mô hình này rất thích nhấn mạnh tầm quan trọng của vấn đề với cụm từ “this matters” (tăng 116 lần) và “why X matters” (tăng 92 lần).
- OpenAI Astra: Thường xuyên sử dụng các cụm từ mang tính chất “khung điều chỉnh” (corrective framing) như “not simply X” hoặc “rather than relying on X”, với tần suất cao gấp 100 lần so với văn bản thông thường. Astra cũng có xu hướng dùng các từ ngữ giảm nhẹ như “may provide” hoặc “can provide”.
Cuộc chiến loại bỏ dấu vết AI
Các phòng thí nghiệm AI đang nỗ lực tinh chỉnh để văn phong máy móc trở nên tự nhiên hơn. Đáng chú ý, việc lạm dụng dấu gạch ngang đã giảm mạnh: Opus 5.5 giảm 99%, Astra giảm 88% và Gemini 3.1 Pro gần như loại bỏ hoàn toàn ký tự này trong văn bản.
Tuy nhiên, theo ông Druck, việc loại bỏ hoàn toàn các “dấu vết” này là một thách thức lớn. “Các mô hình này quá lớn với hàng tỷ tham số. Dù các nhà phát triển cố gắng kiểm soát, những thói quen ngôn ngữ mới vẫn liên tục xuất hiện. Có vẻ như các phòng thí nghiệm không thể kiểm soát hoàn toàn mọi khía cạnh trong cách hành văn của AI như chúng ta kỳ vọng,” ông chia sẻ.
Dù các hãng như Anthropic hay OpenAI liên tục quảng bá về khả năng viết lách tự nhiên, rõ ràng là khoảng cách giữa văn phong AI và con người vẫn là một bài toán chưa có lời giải triệt để.
Nguồn tham khảo: TechCrunch

No Comment! Be the first one.